摘要
同策略自蒸馏(OPSD)利用训练时的特权上下文提升模型能力,但易引发非预期的行为副作用。本文针对稀有令牌/身份设定,提出证据引导的同策略蒸馏(EDGE-OPD)。该方法通过引导式 rollout 在采样时注入特权行为,并应用证据掩码,仅在特权上下文支持的位置更新学生模型。实验表明,传统 OPSD 无法学习目标身份,而 EDGE-OPD 能成功内化特定行为,同时有效保留模型的通用能力。
AI 推荐理由
提出 EDGE-OPD 方法优化自蒸馏,解决特权信息导致的副作用,实现模型能力自我改进。
研究机构
EdgeRunner AI
论文信息