reinforcement learning self-distillation reasoning models style drift
摘要

同策略自蒸馏(OPSD)通过将模型分布与特权上下文下的分布对齐,为推理模型提供密集的令牌级监督。然而,本文发现该学习信号集中于风格令牌而非任务承载令牌,导致“特权诱导的风格漂移”,使训练不稳定或响应缩短。为此,作者提出 RLCSD 方法,通过对比正确提示与错误提示下的师生差距,抑制由提示引起的风格偏移,使信号更聚焦于任务令牌。在 Qwen3 和 Olmo-3 上的实验表明,RLCSD 在数学和逻辑推理任务上 consistently 优于 GRPO 及现有 OPSD 方法。

AI 推荐理由

论文提出 RLCSD 方法,旨在解决推理模型训练中的风格漂移问题,显著提升数学与逻辑推理能力。

研究机构
天津大学 阿里巴巴集团 北京大学
论文信息
作者 Leyi Pan, Shuchang Tao, Yunpeng Zhai, Lingzhe Zhang, Zhaoyang Liu et al.
发布日期 2026-06-10
arXiv ID 2606.11709
相关性评分 9/10 (高度相关)