Self-Distillation Model Alignment Privileged Context LLM Post-training
摘要

同策略自蒸馏(OPSD)利用训练时的特权上下文提升模型能力,但易引发非预期的行为副作用。本文针对稀有令牌/身份设定,提出证据引导的同策略蒸馏(EDGE-OPD)。该方法通过引导式 rollout 在采样时注入特权行为,并应用证据掩码,仅在特权上下文支持的位置更新学生模型。实验表明,传统 OPSD 无法学习目标身份,而 EDGE-OPD 能成功内化特定行为,同时有效保留模型的通用能力。

AI 推荐理由

提出 EDGE-OPD 方法优化自蒸馏,解决特权信息导致的副作用,实现模型能力自我改进。

研究机构
EdgeRunner AI
论文信息
作者 Aristotelis Lazaridis, Dylan Bates, Aman Sharma, Brian King, Vincent Lu et al.
发布日期 2026-05-22
arXiv ID 2605.23493
相关性评分 9/10 (高度相关)