摘要
大型语言模型虽已演变为工具使用型 Agent,但在长程交互中仍显脆弱。不同于数学推理,工具使用失败常导致不可逆副作用,使得步骤级验证至关重要。现有基准多局限于封闭数学领域,无法捕捉工具执行的动态性。为此,本文提出 AgentProcessBench,首个评估真实工具增强轨迹中步骤有效性的基准。该基准包含 1000 条多样化轨迹及 8509 个人类标注步骤,采用三元标签方案捕捉探索行为,并引入错误传播规则以减少标注歧义。实验表明,过程信号能显著补充结果监督,提升测试时扩展能力。
AI 推荐理由
论文聚焦工具使用 Agent 的步骤级质量评估,核心解决技能执行中的错误传播与验证难题。
研究机构
中国人民大学
论文信息