Benchmark Multi-step Reasoning Web Browsing Math Computation Agent Evaluation
摘要

深度研究智能体日益交织网页浏览与多步计算,但现有基准孤立评估这些能力。本文提出 DRBENCHER,一个生成需同时具备浏览与计算能力问题的合成基准生成器。该基准通过统一的答案优先流程,在五个领域强制执行可验证性、复杂性、难度和多样性标准。人工评估显示 76% 的有效性,自动评估表明最强前沿模型准确率仅 20%。相比手动构建的基准,DRBENCHER 实现了最高的语义多样性,揭示了系统在演化数据上推理的局限性。

AI 推荐理由

论文核心评估 Agent 结合检索与数学计算的多步推理能力,提出新基准。

研究机构
IBM
论文信息
作者 Young-Suk Lee, Ramon Fernandez Astudillo, Radu Florian
发布日期 2026-04-10
arXiv ID 2604.09251
相关性评分 9/10 (高度相关)