Self-Distillation Code Generation Self-Improvement Supervised Fine-Tuning
摘要

本文探讨了大型语言模型(LLM)能否仅利用其原始输出,在无需验证器、教师模型或强化学习的情况下提升代码生成能力。研究提出了简单自蒸馏(SSD)方法:通过特定温度和截断配置采样模型解,并利用标准监督微调对其进行训练。实验显示,SSD 将 Qwen3-30B-Instruct 在 LiveCodeBench v6 上的 pass@1 从 42.4% 提升至 55.3%,增益主要集中在难题上,且在不同规模和变体的模型中具有泛化性。分析表明,SSD 通过重塑令牌分布,解决了精度与探索的冲突,抑制了干扰项同时保留了有益多样性,为后训练提供了新方向。

AI 推荐理由

论文提出简单自蒸馏方法,利用模型自身输出进行微调以实现自我改进,核心聚焦于 Agent/LLM 的自我进化机制。

研究机构
Apple
论文信息
作者 Ruixiang Zhang, Richard He Bai, Huangjie Zheng, Navdeep Jaitly, Ronan Collobert et al.
发布日期 2026-04-01
arXiv ID 2604.01193
相关性评分 9/10 (高度相关)