摘要
本文分析了 18 个视觉 - 语言模型(VLM)的推理动态,追踪思维链(CoT)过程中的置信度变化及中间步骤的贡献。研究发现模型存在“答案惯性”,即早期预测倾向被强化而非修正。尽管经推理训练的模型表现出更强的修正行为,但仍易受误导性文本线索影响,即便视觉证据充分。研究表明,CoT 仅能提供多模态决策驱动因素的部分视图,其透明度和安全性面临挑战,因为流畅的 CoT 可能掩盖实际的模态依赖。
AI 推荐理由
论文核心研究 VLM 的推理动态、思维链机制及多模态推理局限性,深度契合主题。
研究机构
University of Copenhagen, Department of Computer Science
University of Sheffield, School of Computer Science
论文信息