摘要
尽管在线策略蒸馏为训练小型推理模型提供了密集监督,但其在多模态领域的优化动态尚未被充分探索。本文挑战了视觉语言模型(VLM)蒸馏的标准整体观,将损失函数数学分解为语言先验和视觉定位两个独立分量。分析发现,这两部分的梯度向量几乎正交,表明对齐教师模型的语言分布与匹配其视觉感知在几何上是独立的。鉴于视觉定位是视觉语言推理的主要瓶颈,我们提出了视觉梯度引导(VGS)方法,动态重定向更新向量以优先优化视觉子空间。实验表明,VGS 在多种蒸馏设置和复杂多模态基准上显著优于标准方法,以极小的训练开销实现了更优的定位能力。
AI 推荐理由
论文聚焦视觉语言推理,提出梯度引导方法解决视觉 grounding 瓶颈,显著提升推理性能。
研究机构
Korea Advanced Institute of Science and Technology (KAIST)
University of Illinois Urbana-Champaign (UIUC)
论文信息