摘要
随着多模态大语言模型在传统视觉推理基准上迅速饱和,一个关键问题浮现:高分是否真正反映了鲁棒的视觉理解?本文识别出一种普遍存在的漏洞——“笛卡尔捷径”,即模型利用基于正交网格布局的基准可被离散化为文本坐标的特性,过度依赖文本演绎推理来辅助视觉问题解决。为系统性地消解这一捷径,我们引入了 Polaris-Bench,将 53 个视觉推理任务重构为极坐标空间形式,同时保留逻辑约束和任务语义,从而从根本上打破了模型所利用的正交先验。对 14 个最先进模型的评估显示,其在笛卡尔布局上取得的 70%-83% 的高分,在极坐标等效任务中骤降至 31%-39%,暴露了当前模型缺乏拓扑不变视觉推理能力的严重缺陷。
AI 推荐理由
论文核心研究多模态模型的视觉推理能力,揭示其依赖坐标捷径而非真正理解。
研究机构
Google DeepMind
论文信息