摘要
本文指出视觉语言模型(VLM)推理能力的缺失源于训练数据中的“报告偏差”,即人类描述视觉内容时往往省略隐含信息。通过分析 OpenCLIP 等模型的数据,发现该偏差导致空间、时间、否定和计数等推理技能表征不足。实验表明,单纯扩大模型或数据规模无法自发涌现这些能力,而引入专门采集隐含信息的标注数据则效果显著。研究强调需通过有意识的数据策展而非依赖规模来提升推理能力。
AI 推荐理由
论文核心研究 VLM 推理能力缺失的根源(报告偏差)及提升方法,直接针对推理技能。
研究机构
华盛顿大学
加州大学洛杉矶分校
米斯特尔AI
艾伦人工智能研究所
论文信息