摘要
深度研究 Agent 通过多轮检索和面向决策的生成处理知识密集型任务。本文系统研究了强化学习在提示模板、奖励函数及策略优化三个维度的作用。研究发现:快速思维模板优于慢速思维;基于 F1 的奖励易导致训练崩溃,引入动作级惩罚后可超越精确匹配奖励;REINFORCE 算法在稳定性和效率上优于 PPO 和 GRPO。基于此,作者提出了 Search-R1++ 基线,显著提升了模型性能,为深度研究系统的强化学习训练提供了原则性指导。
AI 推荐理由
论文核心研究深度检索 Agent 的推理策略优化,通过 RL 提升多轮决策与生成能力。
研究机构
NLPR & MAIS, CASIA
School of AI, UCAS
Meituan Inc.
论文信息