摘要
本文提出技能条件门控自蒸馏(SGSD),旨在通过经验衍生的技能库而非传统可信特权信息来改进大语言模型的推理能力。该方法将基于技能的自蒸馏构建为教师假设验证过程,检索技能 - 错误对并构建多教师池,由验证器评估各教师极性或支持成功或抑制失败。通过鲁棒的门控目标,SGSD 能有效蒸馏有价值的师生分歧信号,同时抑制不确定或极端信号。在多个数学推理基准上的实验表明,SGSD 在较弱的特权信息假设下,性能持续优于 GRPO 并与答案条件化方法具有竞争力。
AI 推荐理由
论文核心提出 SGSD 方法,利用技能库增强自蒸馏以显著提升 LLM 数学推理能力。
研究机构
清华大学
复旦大学
城市大学
香港城市大学
华南理工大学
威斯康星大学麦迪逊分校
论文信息