摘要
代理搜索旨在训练智能体迭代推理、查询并综合信息以回答复杂问题。现有方法通常将检索系统视为固定工具,仅优化推理代理,导致性能瓶颈。本文提出 CoSearch 框架,利用群组相对策略优化(GRPO)联合训练多步推理代理与生成式文档排序模型。通过引入基于令牌相似度的语义分组策略及结合排序质量与轨迹反馈的复合奖励机制,实现了有效训练。在七个问答基准上的实验表明,该方法显著优于现有基线,证明了联合训练推理与检索系统的可行性与高效性。
AI 推荐理由
论文核心在于联合训练多步推理代理与检索模型,推理是解决复杂问答的关键机制。
研究机构
Center for Intelligent Information Retrieval, University of Massachusetts Amherst
Snap Inc.
论文信息