Tool Use Benchmark Process Supervision Agent Evaluation
摘要

大型语言模型虽已演变为工具使用型 Agent,但在长程交互中仍显脆弱。不同于数学推理,工具使用失败常导致不可逆副作用,使得步骤级验证至关重要。现有基准多局限于封闭数学领域,无法捕捉工具执行的动态性。为此,本文提出 AgentProcessBench,首个评估真实工具增强轨迹中步骤有效性的基准。该基准包含 1000 条多样化轨迹及 8509 个人类标注步骤,采用三元标签方案捕捉探索行为,并引入错误传播规则以减少标注歧义。实验表明,过程信号能显著补充结果监督,提升测试时扩展能力。

AI 推荐理由

论文聚焦工具使用 Agent 的步骤级质量评估,核心解决技能执行中的错误传播与验证难题。

研究机构
中国人民大学
论文信息
作者 Shengda Fan, Xuyan Ye, Yupeng Huo, Zhi-Yuan Chen, Yiju Guo et al.
发布日期 2026-03-15
arXiv ID 2603.14465
相关性评分 9/10 (高度相关)