Reinforcement Learning Knowledge Distillation Reasoning Alignment LLM Training
摘要

同策略强化学习是大语言模型推理对齐的主流范式,但其稀疏的结果级奖励导致令牌级信用分配困难。同策略蒸馏(OPD)虽引入教师模型的密集令牌级 KL 监督,却常忽略信号质量差异而均匀应用。本文提出 SCOPE,一种双路径自适应训练框架,根据正确性将轨迹路由至两条互补监督路径:对错误轨迹执行教师困惑度加权 KL 蒸馏,优先利用教师具备真正修正能力的实例;对正确轨迹应用学生困惑度加权最大似然估计,聚焦能力边界上的低置信度样本。实验表明,SCOPE 在六个推理基准上平均相对提升显著。

AI 推荐理由

论文核心解决大模型推理对齐中的奖励稀疏问题,通过新蒸馏框架显著提升推理基准表现。

研究机构
University of Science and Technology of China Nanjing University Fudan University Huazhong University of Science and Technology
论文信息
作者 Binbin Zheng, Xing Ma, Yiheng Liang, Jingqing Ruan, Xiaoliang Fu et al.
发布日期 2026-04-12
arXiv ID 2604.10688
相关性评分 9/10 (高度相关)