Long-Horizon Tasks Failure Diagnosis Agent Benchmark LLM-as-a-Judge
摘要

大型语言模型代理在短中期任务表现优异,但在需扩展依赖动作序列的长程任务中常失效。为此,本文提出 HORIZON,一个跨领域诊断基准,用于系统构建任务并分析长程失败行为。研究评估了多个模型家族的先进代理,收集超 3100 条轨迹以研究随 horizon 增加的退化模式。此外,提出基于轨迹的“大模型即裁判”流程进行可扩展的失败归因,并经人工标注验证具有高度一致性。该工作为系统性分析长程代理失败提供了方法论步骤及实践指导。

AI 推荐理由

论文核心研究长程任务中代理系统的规划失败诊断,直接针对多步计划与目标导向行为。

研究机构
University of Wisconsin-Madison University of California, Berkeley Georgia Institute of Technology
论文信息
作者 Xinyu Jessica Wang, Haoyue Bai, Yiyou Sun, Haorui Wang, Shuibai Zhang et al.
发布日期 2026-04-13
arXiv ID 2604.11978
相关性评分 9/10 (高度相关)