摘要
针对现有关策略强化学习算法(如 GRPO)样本效率低及经验回放易导致模式坍塌的问题,本文提出动态 Jensen-Shannon 回放(DyJR)框架。该方法主张历史数据应优先维持多样性而非单纯强化准确性。DyJR 引入两项创新:一是利用 FIFO 和自适应大小的时间敏感动态缓冲区,仅保留时序邻近样本以同步模型演化;二是采用 Jensen-Shannon 散度正则化替代直接梯度更新,防止多样性丧失。在数学推理与 Text-to-SQL 基准上的实验表明,DyJR 显著优于 GRPO 及其他基线,同时保持了相当的训练效率。
AI 推荐理由
论文核心旨在通过改进 RL 训练机制提升 LLM 的数学推理能力,实验验证聚焦推理基准。
研究机构
中国科学院自动化研究所
中国科学院大学
论文信息