摘要
本文针对大型语言模型智能体在专业数据检索任务中的不足,提出了“状态门控检索”(SGR)概念,即需通过过滤器或层级建立正确站点状态才能获取证据。作者构建了包含 100 个专家策划任务的 SGR-Bench 基准,涵盖六个来源家族。评估显示,现有最强系统仅达 66.18% 的项目级 F1 分数,主要失败原因在于检索范围漂移和标准不匹配,而非答案生成。该研究揭示了智能体在复杂工具交互与状态配置技能上的关键缺陷。
AI 推荐理由
论文核心研究 Agent 在特定网站状态下使用过滤、层级等工具进行检索的技能。
研究机构
1Peking University
2Beijing University of Technology
论文信息