PlanGPT 自动规划 性能评估 LLM 基准测试
摘要

自动规划旨在生成从初始状态到达目标状态的动作序列。本文对前沿大语言模型 PlanGPT 进行了补充研究,重新实验以验证基于 LLM 的规划是否切实有效且值得投入。研究不仅核查了原论文中计划覆盖率的准确性,还利用计划成本和生成时间两项指标对 PlanGPT 进行了更全面的评估,并将其与传统规划器进行对比。结果显示,PlanGPT 的表现并未优于贪婪搜索策略,揭示了当前 LLM 在规划任务中的局限性。

AI 推荐理由

论文核心评估 LLM 在自动规划中的性能,对比传统规划器,直接研究规划能力。

研究机构
Univ. Grenoble Alpes - LIG
论文信息
作者 Youssef Abdelkader, Humbert Fiorino, Damien Pellier
发布日期 2026-06-09
arXiv ID 2606.10489
相关性评分 9/10 (高度相关)