Vision-Language Models Chain-of-Thought Reasoning Dynamics Modality Reliance
摘要

本文分析了 18 个视觉 - 语言模型(VLM)的推理动态,追踪思维链(CoT)过程中的置信度变化及中间步骤的贡献。研究发现模型存在“答案惯性”,即早期预测倾向被强化而非修正。尽管经推理训练的模型表现出更强的修正行为,但仍易受误导性文本线索影响,即便视觉证据充分。研究表明,CoT 仅能提供多模态决策驱动因素的部分视图,其透明度和安全性面临挑战,因为流畅的 CoT 可能掩盖实际的模态依赖。

AI 推荐理由

论文核心研究 VLM 的推理动态、思维链机制及多模态推理局限性,深度契合主题。

研究机构
University of Copenhagen, Department of Computer Science University of Sheffield, School of Computer Science
论文信息
作者 Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott
发布日期 2026-04-16
arXiv ID 2604.14888
相关性评分 9/10 (高度相关)