摘要
针对视觉语言模型能识别图像却无法基于其进行正确推理的现象,本文定义了“感知 - 整合鸿沟”。为此,作者提出了 DISSECT,一个包含 1.2 万问题的化学与生物学诊断基准。通过五种输入模式(包括新颖的“模型预言机”模式),该基准将性能分解为语言先验利用、视觉提取、感知保真度及整合有效性。评估 18 个模型发现,开源模型在基于自身描述推理时表现优于直接处理图像,揭示了系统性整合瓶颈,而闭源模型则无此问题,表明感知与推理的整合是当前多模态能力的关键前沿。
AI 推荐理由
论文核心研究视觉信息提取与下游推理间的断裂,提出诊断基准评估多模态推理能力。
研究机构
IIT Delhi, India
论文信息