Reinforcement Learning Agent Stability Policy Optimization LLM Agents
摘要

代理强化学习(ARL)在解决复杂多步交互任务方面前景广阔,但常因训练不稳定导致崩溃,限制了其扩展性。本文提出 ARLArena,这是一个稳定的训练方案及系统分析框架,旨在可控且可复现的环境中评估训练稳定性。通过将策略梯度分解为四个核心设计维度并进行细粒度分析,我们提炼出统一视角并提出 SAMPO,一种旨在缓解主要不稳定源的稳定代理策略优化方法。实验表明,SAMPO 在多样代理任务中实现了持续稳定的训练和卓越性能,为构建稳定的 LLM 代理训练流水线提供了实践指导。

AI 推荐理由

论文核心解决 Agent 强化学习训练不稳定问题,提出自我优化方法,属于自我进化范畴。

研究机构
加利福尼亚大学洛杉矶分校 威斯康星大学麦迪逊分校
论文信息
作者 Xiaoxuan Wang, Han Zhang, Haixin Wang, Yidan Shi, Ruoyan Li et al.
发布日期 2026-02-25
arXiv ID 2602.21534
相关性评分 9/10 (高度相关)