Reinforcement Learning Deep Research Agent Training Policy Optimization Reward Design
摘要

深度研究 Agent 通过多轮检索和面向决策的生成处理知识密集型任务。本文系统研究了强化学习在提示模板、奖励函数及策略优化三个维度的作用。研究发现:快速思维模板优于慢速思维;基于 F1 的奖励易导致训练崩溃,引入动作级惩罚后可超越精确匹配奖励;REINFORCE 算法在稳定性和效率上优于 PPO 和 GRPO。基于此,作者提出了 Search-R1++ 基线,显著提升了模型性能,为深度研究系统的强化学习训练提供了原则性指导。

AI 推荐理由

论文核心研究深度检索 Agent 的推理策略优化,通过 RL 提升多轮决策与生成能力。

研究机构
NLPR & MAIS, CASIA School of AI, UCAS Meituan Inc.
论文信息
作者 Yinuo Xu, Shuo Lu, Jianjie Cheng, Meng Wang, Qianlong Xie et al.
发布日期 2026-02-23
arXiv ID 2602.19526
相关性评分 9/10 (高度相关)