Reinforcement Learning Mathematical Reasoning Diversity Preservation LLM Training
摘要

针对现有关策略强化学习算法(如 GRPO)样本效率低及经验回放易导致模式坍塌的问题,本文提出动态 Jensen-Shannon 回放(DyJR)框架。该方法主张历史数据应优先维持多样性而非单纯强化准确性。DyJR 引入两项创新:一是利用 FIFO 和自适应大小的时间敏感动态缓冲区,仅保留时序邻近样本以同步模型演化;二是采用 Jensen-Shannon 散度正则化替代直接梯度更新,防止多样性丧失。在数学推理与 Text-to-SQL 基准上的实验表明,DyJR 显著优于 GRPO 及其他基线,同时保持了相当的训练效率。

AI 推荐理由

论文核心旨在通过改进 RL 训练机制提升 LLM 的数学推理能力,实验验证聚焦推理基准。

研究机构
中国科学院自动化研究所 中国科学院大学
论文信息
作者 Long Li, Zhijian Zhou, Tianyi Wang, Weidi Xu, Zuming Huang et al.
发布日期 2026-03-17
arXiv ID 2603.16157
相关性评分 9/10 (高度相关)