摘要
异步强化学习通过解耦样本生成与策略优化提升了大语言模型代理的吞吐量,但也引入了 PPO 风格非策略校正的关键失效模式。本文指出,异构训练系统中常因延迟更新丢失历史训练侧 logits,导致分布差异修复与策略陈旧性校正纠缠,破坏了解耦校正的语义。为此,研究提出了三种精确获取旧 logits 的策略及一种基于近似策略的修正方法,并采用改进的 PPO-EWMA 方法,显著提升了训练速度与优化性能。
AI 推荐理由
论文核心解决异步 RL 中策略更新与自我改进的语义错位问题,直接关乎 Agent 的自我进化机制。
研究机构
天津大学
清华大学
北京大学
JD AI Infra
论文信息