摘要
策略自蒸馏(OPSD)作为可验证奖励强化学习(RLVR)的替代方案,虽能通过令牌级信用分配提高准确性并缩短响应,但在启用思维的数学推理任务中效果不佳。本文假设事后监督在短轨迹中能提供更好替代,而在长思维轨迹中更易识别冗余。实验表明,OPSD 在此场景下主要表现为压缩机制而非修正机制:仅基于正确轨迹训练可在保持准确率的同时显著缩短回答,而基于错误轨迹训练则损害性能。据此,作者提出“监督微调 -RLVR-OPSD
AI 推荐理由
论文聚焦数学推理模型的训练后压缩,核心解决思维链冗余问题,直接提升推理效率。
研究机构
延世大学
论文信息