摘要
针对现有强化学习训练大模型进行搜索增强推理时依赖轨迹级奖励导致的梯度信号稀疏问题,本文提出 IG-Search 框架。该方法引入基于信息增益的步级奖励机制,通过衡量检索文档相对于随机基线对黄金答案置信度的提升,量化搜索查询的有效性。利用 GRPO 中的逐 token 优势调制,将信号反馈至搜索查询令牌,实现细粒度的信用分配。实验表明,该方法在多个问答基准上显著优于现有轨迹级及步级基线,尤其在多跳推理任务中表现突出,且仅增加少量训练时间。
AI 推荐理由
论文提出基于信息增益的步级奖励机制,核心旨在增强 LLM 的搜索增强推理能力,特别是多跳推理任务。
研究机构
Kuaishou Technology
论文信息