Reinforcement Learning Multi-hop QA Agentic Search Credit Assignment
摘要

在代理搜索中,大语言模型被训练用于执行多轮检索与推理以解决复杂任务(如多跳问答)。然而,现有基于搜索的强化学习方法存在两大局限:昂贵的长程滚动利用不足,且监督信号仅存在于最终答案,导致奖励稀疏。本文提出 PRAISE 框架,旨在提升数据效率与信用分配。该方法从完整搜索轨迹中提取不同轮次的前缀状态,生成中间答案,并利用这些前缀构建额外训练轨迹及推导步级奖励。实验表明,PRAISE 在多跳问答基准上显著优于强基线。

AI 推荐理由

论文核心解决多跳问答中的多轮推理训练问题,通过中间步奖励优化推理过程。

研究机构
Renmin University of China Xiaohongshu Inc. University of Southern California
论文信息
作者 Erhan Zhang, Yiqun Chen, Zechun Niu, Wei Yang, Xiaochi Wei et al.
发布日期 2026-04-04
arXiv ID 2604.03675
相关性评分 9/10 (高度相关)