摘要
近期潜在视觉推理方法通过向多模态语言模型插入连续潜在令牌取得显著进展,通常归因于其编码了视觉证据。然而分析显示存在悖论:这些令牌与图像关联松散且对答案贡献甚微。本文将潜在令牌分解为潜在槽位、边界标记和格式三个组件进行探测。实验表明,潜在槽位未能验证视觉记忆假说,而仅保留边界标记即可在多种设置下保留 78% 至 100% 的性能增益。研究发现增益主要源于边界标记、格式及特定的注意力模式,而非视觉记忆存储。该研究强调评估需关注模型实际依赖的机制。
AI 推荐理由
论文深入剖析潜在视觉推理的内在机制,揭示性能提升源于格式标记而非视觉记忆,核心聚焦推理能力。
研究机构
Amap, Alibaba Group
论文信息