Visual Reasoning Chain-of-Thought Latent Tokens Vision-Language Models
摘要

人类可通过心理模拟中间视觉步骤解决复杂问题。受此启发,近期研究探索利用连续潜在令牌作为视觉语言模型思维链中的中间想象步骤。本文发现,将潜在令牌替换为无信息虚拟令牌不影响模型精度,表明其因果作用微弱。分析揭示两大阻碍:一是现有数据集中 oracle 潜在令牌信息增量有限,导致训练时被忽略;二是推理时生成的潜在令牌偏离 oracle 表示并发生坍塌。研究指出,未来进展依赖于提供丰富中间步骤的高质量数据集及更精准的潜在令牌预测。

AI 推荐理由

论文核心研究视觉推理中潜在令牌的作用机制,分析其因果性及失败原因。

研究机构
Instituto Superior Técnico, Universidade de Lisboa TransPerfect Instituto de Telecomunicações
论文信息
作者 André G. Viveiros, Nuno Gonçalves, André F. T. Martins, Matthias Lindemann
发布日期 2026-05-18
arXiv ID 2605.18445
相关性评分 9/10 (高度相关)