On-Policy Distillation Multimodal Reasoning Training Stability Global Normalization
摘要

在线策略蒸馏(OPD)作为一种重要的后训练范式,利用更强的教师模型为采样轨迹提供密集监督,优于依赖稀疏反馈的强化学习。然而, naive 的 token 级蒸馏因异常状态下的幅度错位易导致梯度不稳定。为此,本文提出全局归一化蒸馏策略优化(GNDPO),通过将原始 KL 散度转化为批次级相对优势来稳定优化过程。该方法有效缓解了梯度爆炸,同时保留了 token 级指导的优势。实验表明,GNDPO 显著提升了多模态推理任务的训练鲁棒性及下游性能。

AI 推荐理由

论文核心解决多模态大模型推理任务中的训练不稳定问题,直接提升推理能力。

研究机构
OPPO AI Center
论文信息
作者 Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu
发布日期 2026-06-08
arXiv ID 2606.09091
相关性评分 9/10 (高度相关)