摘要
同策略蒸馏(OPD)通过在教师监督下训练学生模仿其自身策略轨迹来提升推理能力。在多模态场景中,常用拥有特权信息(如参考答案)的教师,但这导致训练与测试不匹配,诱发捷径模仿而非基于视觉的推理。本文提出 ViCuR 框架,用输入中可恢复的视觉线索替代答案侧特权。ViCuR 引入轻量级线索恢复模块,利用专用 sink-token 交叉注意力聚合视觉证据,无需改变推理接口。在七个基准测试中,ViCuR 显著优于基于答案的蒸馏基线,证明了教师特权设计在多模态同策略蒸馏中的关键作用。
AI 推荐理由
论文核心在于通过改进蒸馏框架提升多模态推理能力,解决视觉 grounding 问题。
研究机构
Shanghai AI Laboratory
Fudan University
Nanjing University
论文信息