摘要
搜索增强推理代理将内部推理与外部检索调用交错进行,其性能取决于查询质量。然而,基于结果奖励的强化学习无法为单个查询提供步级信用分配。现有方法依赖外部教师模型或标注数据。本文提出 SD-Search,通过在线策略事后自蒸馏从策略自身推导步级监督信号,无需外部教师或额外标注。该方法利用同一模型扮演学生与教师角色,教师基于事后信息总结搜索轨迹,学生通过最小化令牌级散度学习教师的优质查询分布,从而在标准 RL 训练中实现密集的步级信号增强。
AI 推荐理由
论文核心研究搜索增强推理中的步级监督机制,通过自蒸馏提升查询质量与推理性能。
研究机构
Kuaishou Technology
论文信息