摘要
随着大语言模型在代理循环中能力的提升,词汇检索器是否仍足以支撑深度研究系统?本文通过结合 BM25 与具备更强推理及工具使用能力的前沿大模型,重新探讨了这一问题。为此,我们推出了 Pi-Serini,一个配备检索、浏览和阅读三种工具的搜索代理。实验表明,在 BrowseComp-Plus 基准上,配置得当且具备足够检索深度的词汇检索器,配合高性能大模型可有效支持深度研究。具体而言,搭载 gpt-5.5 的 Pi-Serini 实现了 83.1% 的答案准确率和 94.7% 的证据召回率,优于使用稠密检索器的现有代理。消融实验进一步显示,优化 BM25 参数可将准确率提升 18.0%,证据召回率提升 11.1%;增加检索深度则使证据召回率较浅层设置再提升 25.3%。
AI 推荐理由
论文核心研究 Agent 的工具使用(检索、浏览、阅读),评估不同检索技能对任务效果的影响。
研究机构
University of Waterloo
Stencelizeit
论文信息