Reinforcement Learning Tool Use Search Agent Training Stability GRPO
摘要

基于工具的智能体强化学习(TARL)是训练搜索智能体自主交互外部工具的重要范式,但存在导致模型崩溃的训练不稳定问题(ISDD)。本文提出搜索智能体策略优化(SAPO),通过条件令牌级 KL 约束稳定训练。该方法仅对概率低且策略偏移过大的正令牌施加惩罚,防止分布漂移同时保留梯度流。SAPO 仅需对标准 GRPO 算法进行一行代码修改即可部署。实验表明,其在七个问答基准上较 Search-R1 取得显著性能提升,且在不同模型规模和家族中表现一致。

AI 推荐理由

论文核心解决基于工具的智能体(Search Agent)在强化学习训练中的崩溃问题,直接提升工具使用能力。

研究机构
南京大学
论文信息
作者 Jian Li, Dongsheng Chen, Zhenhua Xu, Yizhang Jin, Jiafu Wu et al.
发布日期 2026-03-10
arXiv ID 2603.10069
相关性评分 9/10 (高度相关)