Self-Distillation Reinforcement Learning LLM Reasoning Curriculum Learning
摘要

本文针对自蒸馏策略优化(SDPO)缺乏难度感知的问题,通过分析 GRPO 的优势归一化机制,提出了一种通过率加权方法。该方法将每个问题的损失权重设为预测通过率的函数,从而隐式构建动态课程学习,聚焦于中等难度样本。在科学推理和工具使用基准上的实验表明,该改进方案显著提升了模型性能,同时保持了训练稳定性。

AI 推荐理由

论文核心提出加权自蒸馏方法,旨在显著提升 LLM 在科学推理等任务上的表现。

研究机构
College of Information Sciences and Technology, Pennsylvania State University
论文信息
作者 Zehao Liu, Yuanpu Cao, Jinghui Chen, Vasant G. Honavar
发布日期 2026-05-26
arXiv ID 2605.27765
相关性评分 9/10 (高度相关)