摘要
大型语言模型在复杂推理任务中的对齐严重依赖可验证奖励的强化学习(RLVR)。然而,现有算法将序列级奖励均匀应用于所有令牌,导致严重的信用分配瓶颈。针对自蒸馏方法中存在的过度条件化和训练崩溃问题,本文提出不对称元反思自蒸馏(AMR-SD)。该方法引入反思瓶颈,将诊断信号压缩为简洁的苏格拉底式提示与批判,并结合因果信息增益机制,实现稀疏且精确的令牌级优势调制。实验表明,该方法在科学、数学及工具使用基准上显著优于基线,有效防止了后期训练崩溃并提升了长程稳定性。
AI 推荐理由
论文核心解决复杂推理中的令牌级信用分配瓶颈,通过新机制显著提升推理能力。
研究机构
Meituan Beijing
University of Chinese Academy of Sciences
论文信息