摘要
同策略自蒸馏(OPSD)通过将模型分布与特权上下文下的分布对齐,为推理模型提供密集的令牌级监督。然而,本文发现该学习信号集中于风格令牌而非任务承载令牌,导致“特权诱导的风格漂移”,使训练不稳定或响应缩短。为此,作者提出 RLCSD 方法,通过对比正确提示与错误提示下的师生差距,抑制由提示引起的风格偏移,使信号更聚焦于任务令牌。在 Qwen3 和 Olmo-3 上的实验表明,RLCSD 在数学和逻辑推理任务上 consistently 优于 GRPO 及现有 OPSD 方法。
AI 推荐理由
论文提出 RLCSD 方法,旨在解决推理模型训练中的风格漂移问题,显著提升数学与逻辑推理能力。
研究机构
天津大学
阿里巴巴集团
北京大学
论文信息