摘要
强化学习在大语言模型后训练中成效显著,但主流在线策略算法样本效率低下。虽然经验回放可提升效率,但直接应用于大模型时,因参数规模巨大导致策略快速演化,使得存储的优先级迅速过时。本文提出新鲜度感知优先经验回放(Freshness-Aware PER),通过引入基于有效样本量分析的指数年龄衰减因子,解决了优先级陈旧问题。在多个智能体、推理及数学任务上的实验表明,该方法显著优于在线基线,而传统优先经验回放则导致性能下降。
AI 推荐理由
论文提出新机制解决大模型强化学习中策略快速演化导致的经验过时问题,核心关注自我进化过程。
研究机构
King Abdullah University of Science and Technology (KAUST)
Chinese Academy of Sciences, Institute of Automation (CASIA)
AI Centre, Department of Computer Science, University College London
Zhongguancun Institute of Artificial Intelligence
论文信息