Agentic Search Retrieval Augmentation Self-Reflection Feedback Loop
摘要

代理搜索系统通过迭代交互检索模型来回答复杂查询,但优化检索器仍具挑战。本文提出 Critic-R 框架,在推理和训练阶段显式闭合推理代理与检索模型间的反馈回路。该框架引入批评模型,评估代理消耗检索证据后的内省推理轨迹,判断上下文是否足以支持下一步推理。Critic-R 包含两种互补机制:Critic-R-Zero 用于推理时的查询细化循环,Critic-Embed 则利用成功与失败的细化轨迹作为自动监督来优化检索模型,无需人工标注。实验表明该方法显著提升了检索质量与答案准确率。

AI 推荐理由

论文核心在于利用内省反馈优化检索以支持多步推理,直接提升 Agent 的推理质量。

研究机构
Center for Intelligent Information Retrieval, University of Massachusetts Amherst
论文信息
作者 Md Zarif Ul Alam, Alireza Salemi, Hamed Zamani
发布日期 2026-05-30
arXiv ID 2606.00590
相关性评分 9/10 (高度相关)