摘要
大型语言模型代理在短中期任务表现优异,但在需扩展依赖动作序列的长程任务中常失效。为此,本文提出 HORIZON,一个跨领域诊断基准,用于系统构建任务并分析长程失败行为。研究评估了多个模型家族的先进代理,收集超 3100 条轨迹以研究随 horizon 增加的退化模式。此外,提出基于轨迹的“大模型即裁判”流程进行可扩展的失败归因,并经人工标注验证具有高度一致性。该工作为系统性分析长程代理失败提供了方法论步骤及实践指导。
AI 推荐理由
论文核心研究长程任务中代理系统的规划失败诊断,直接针对多步计划与目标导向行为。
研究机构
University of Wisconsin-Madison
University of California, Berkeley
Georgia Institute of Technology
论文信息