摘要
大型语言模型在结合外部信息时表现更可靠,但处理需多步推理的复杂查询仍具挑战。现有方法多基于结果进行强化学习。本文提出 SubSearch 框架,从仅监督结果转向利用中间奖励信号,激励高质量推理规划。与依赖人工或大模型标注的过程奖励不同,SubSearch 利用内在推导的奖励直接优化生成器,无需外部监督。实验表明,该方法在多个基准测试中显著提升了问答及多跳问答任务的推理鲁棒性,为构建集成搜索引擎的智能体提供了数据高效的解决方案。
AI 推荐理由
论文核心提出利用内在中间奖励引导复杂检索中的多步推理,直接优化推理轨迹质量。
研究机构
IRLab, University of Amsterdam
论文信息