摘要
代理强化学习(ARL)在解决复杂多步交互任务方面前景广阔,但常因训练不稳定导致崩溃,限制了其扩展性。本文提出 ARLArena,这是一个稳定的训练方案及系统分析框架,旨在可控且可复现的环境中评估训练稳定性。通过将策略梯度分解为四个核心设计维度并进行细粒度分析,我们提炼出统一视角并提出 SAMPO,一种旨在缓解主要不稳定源的稳定代理策略优化方法。实验表明,SAMPO 在多样代理任务中实现了持续稳定的训练和卓越性能,为构建稳定的 LLM 代理训练流水线提供了实践指导。
AI 推荐理由
论文核心解决 Agent 强化学习训练不稳定问题,提出自我优化方法,属于自我进化范畴。
研究机构
加利福尼亚大学洛杉矶分校
威斯康星大学麦迪逊分校
论文信息