摘要
近期 VLM 的“思考 - 回答”模式虽提升了推理性能,但高昂的计算成本限制了部署。为将此能力蒸馏至紧凑模型,本文提出一种新框架,通过掩码学生模型显著的推理前缀,迫使其在推理链中更多依赖视觉证据而非文本线索。该方法包含令牌级显著前缀掩码和基于蒸馏难度的自步掩码预算调度。实验表明,该 approach 在多模态推理基准上优于现有开源 VLM 及蒸馏方法,并证实增强了学生模型思考过程中的视觉利用率。
AI 推荐理由
论文核心在于通过掩码策略增强 VLM 在推理过程中对视觉证据的利用,直接提升多模态推理能力。
研究机构
KAIST
NVIDIA
论文信息