Self-Distillation RLVR Reasoning Exploration Information Asymmetry
摘要

自蒸馏已成为大语言模型后训练的强大框架,其中利用额外信息的教师指导无此信息的学生。然而,在成功轨迹中,这种机制会覆盖学生的选择并抑制其自身推理。为此,本文提出反向解读自蒸馏信号:当学生在教师未预测的路径上成功时,这些 token 反映了其自主推理。基于此,我们提出 RLRT(带反转教师的 RLVR),通过在正确轨迹上强化这些 token 来增强 GRPO。这被视为一种新的探索形式,即基于学生自身成功的有价值探索。实验表明,RLRT 在多个 Qwen3 检查点上显著优于自蒸馏及基于探索的基线。

AI 推荐理由

论文核心提出反转教师信号以激发学生自主推理,直接针对推理探索机制进行优化。

研究机构
Microsoft Research
论文信息
作者 Jeonghye Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang
发布日期 2026-05-11
arXiv ID 2605.10781
相关性评分 9/10 (高度相关)