摘要
在代理搜索中,大语言模型被训练用于执行多轮检索与推理以解决复杂任务(如多跳问答)。然而,现有基于搜索的强化学习方法存在两大局限:昂贵的长程滚动利用不足,且监督信号仅存在于最终答案,导致奖励稀疏。本文提出 PRAISE 框架,旨在提升数据效率与信用分配。该方法从完整搜索轨迹中提取不同轮次的前缀状态,生成中间答案,并利用这些前缀构建额外训练轨迹及推导步级奖励。实验表明,PRAISE 在多跳问答基准上显著优于强基线。
AI 推荐理由
论文核心解决多跳问答中的多轮推理训练问题,通过中间步奖励优化推理过程。
研究机构
Renmin University of China
Xiaohongshu Inc.
University of Southern California
论文信息