Travel Planning LLM Evaluation Long-horizon Reasoning Error Analysis
摘要

旅行规划是长程推理的关键任务,暴露了大语言模型的显著缺陷。现有基准多以端到端方式评估最终计划,缺乏可解释性且难以分析失败根源。为此,我们将旅行规划分解为约束提取、工具使用、计划生成、错误识别与纠正五个原子子能力,并利用预言机中间上下文实施解耦评估协议,以隔离组件并测量原子性能边界。结果表明,模型擅长提取显式约束,但在推断隐式需求、计划结构及自我纠正方面存在严重不足。

AI 推荐理由

论文核心聚焦旅行规划任务,分解规划子能力并评估,直接针对规划机制。

研究机构
State Key Laboratory of Novel Software Technology, Nanjing University, China
论文信息
作者 Bo-Wen Zhang, Jin Ye, Peng-Yu Hua, Jia-Wei Cao, Jie-Jing Shao et al.
发布日期 2026-05-05
arXiv ID 2605.03308
相关性评分 9/10 (高度相关)