摘要
利用基于思维链(CoT)的多模态推理模型虽革新了数学与逻辑问题解决,但在通用空间智能方面表现不佳。本文评估了 17 个模型在 13 个空间基准上的表现,发现 CoT 提示一致降低了视觉空间推理性能。通过新颖的无图++消融实验,证明模型存在严重的捷径学习问题,即便缺失图像也会依据文本先验幻觉出视觉细节。这些发现挑战了纯文本 CoT 在空间任务中的有效性,强调了以视觉为中心的推理范式的必要性。
AI 推荐理由
论文核心研究思维链(CoT)对多模态模型空间推理能力的负面影响及机制。
研究机构
IIT, Hyderabad
Microsoft Research India
论文信息