摘要
同策略强化学习是大语言模型推理对齐的主流范式,但其稀疏的结果级奖励导致令牌级信用分配困难。同策略蒸馏(OPD)虽引入教师模型的密集令牌级 KL 监督,却常忽略信号质量差异而均匀应用。本文提出 SCOPE,一种双路径自适应训练框架,根据正确性将轨迹路由至两条互补监督路径:对错误轨迹执行教师困惑度加权 KL 蒸馏,优先利用教师具备真正修正能力的实例;对正确轨迹应用学生困惑度加权最大似然估计,聚焦能力边界上的低置信度样本。实验表明,SCOPE 在六个推理基准上平均相对提升显著。
AI 推荐理由
论文核心解决大模型推理对齐中的奖励稀疏问题,通过新蒸馏框架显著提升推理基准表现。
研究机构
University of Science and Technology of China
Nanjing University
Fudan University
Huazhong University of Science and Technology
论文信息