摘要
在线策略蒸馏(OPD)作为一种重要的后训练范式,利用更强的教师模型为采样轨迹提供密集监督,优于依赖稀疏反馈的强化学习。然而, naive 的 token 级蒸馏因异常状态下的幅度错位易导致梯度不稳定。为此,本文提出全局归一化蒸馏策略优化(GNDPO),通过将原始 KL 散度转化为批次级相对优势来稳定优化过程。该方法有效缓解了梯度爆炸,同时保留了 token 级指导的优势。实验表明,GNDPO 显著提升了多模态推理任务的训练鲁棒性及下游性能。
AI 推荐理由
论文核心解决多模态大模型推理任务中的训练不稳定问题,直接提升推理能力。
研究机构
OPPO AI Center
论文信息