Vision-Language Models Reporting Bias Reasoning Capabilities Data Curation
摘要

本文指出视觉语言模型(VLM)推理能力的缺失源于训练数据中的“报告偏差”,即人类描述视觉内容时往往省略隐含信息。通过分析 OpenCLIP 等模型的数据,发现该偏差导致空间、时间、否定和计数等推理技能表征不足。实验表明,单纯扩大模型或数据规模无法自发涌现这些能力,而引入专门采集隐含信息的标注数据则效果显著。研究强调需通过有意识的数据策展而非依赖规模来提升推理能力。

AI 推荐理由

论文核心研究 VLM 推理能力缺失的根源(报告偏差)及提升方法,直接针对推理技能。

研究机构
华盛顿大学 加州大学洛杉矶分校 米斯特尔AI 艾伦人工智能研究所
论文信息
作者 Amita Kamath, Jack Hessel, Khyathi Chandu, Jena D. Hwang, Kai-Wei Chang et al.
发布日期 2026-02-26
arXiv ID 2602.23351
相关性评分 9/10 (高度相关)