Agent Benchmark Tool Use Web Retrieval State Management
摘要

本文针对大型语言模型智能体在专业数据检索任务中的不足,提出了“状态门控检索”(SGR)概念,即需通过过滤器或层级建立正确站点状态才能获取证据。作者构建了包含 100 个专家策划任务的 SGR-Bench 基准,涵盖六个来源家族。评估显示,现有最强系统仅达 66.18% 的项目级 F1 分数,主要失败原因在于检索范围漂移和标准不匹配,而非答案生成。该研究揭示了智能体在复杂工具交互与状态配置技能上的关键缺陷。

AI 推荐理由

论文核心研究 Agent 在特定网站状态下使用过滤、层级等工具进行检索的技能。

研究机构
1Peking University 2Beijing University of Technology
论文信息
作者 Ningyuan Li, Haiyang Shen, Mugeng Liu, Yudong Han, Zhuofan Shi et al.
发布日期 2026-05-21
arXiv ID 2605.22219
相关性评分 9/10 (高度相关)