Multimodal Reasoning On-Policy Distillation Visual Grounding Knowledge Distillation
摘要

同策略蒸馏(OPD)通过在教师监督下训练学生模仿其自身策略轨迹来提升推理能力。在多模态场景中,常用拥有特权信息(如参考答案)的教师,但这导致训练与测试不匹配,诱发捷径模仿而非基于视觉的推理。本文提出 ViCuR 框架,用输入中可恢复的视觉线索替代答案侧特权。ViCuR 引入轻量级线索恢复模块,利用专用 sink-token 交叉注意力聚合视觉证据,无需改变推理接口。在七个基准测试中,ViCuR 显著优于基于答案的蒸馏基线,证明了教师特权设计在多模态同策略蒸馏中的关键作用。

AI 推荐理由

论文核心在于通过改进蒸馏框架提升多模态推理能力,解决视觉 grounding 问题。

研究机构
Shanghai AI Laboratory Fudan University Nanjing University
论文信息
作者 Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong et al.
发布日期 2026-06-04
arXiv ID 2606.05718
相关性评分 9/10 (高度相关)