Visual Reasoning Multimodal LLM Benchmark Grounding
摘要

指代表达理解(REC)旨在将语言与区域级视觉感知相连接。尽管现有基准在多模态大模型推动下进展迅速,但在测试视觉推理和定位能力方面仍显不足:表达过短、干扰项少及描述冗余导致模型可利用捷径而非真正推理。为此,本文提出 Ref-Adv,一个现代 REC 基准,通过配对语言复杂的表达与仅含必要信息的图像来抑制捷径。该数据集包含真实图像上的指代表达,精心设计了困难干扰项,并标注了包括否定在内的推理要素。实验表明,当代多模态大模型在 Ref-Adv 上表现显著下降,暴露了其对捷径的依赖及视觉推理能力的缺失。

AI 推荐理由

论文核心在于评估和提升多模态大模型的视觉推理与 grounding 能力,通过构建新基准揭示现有模型的推理缺陷。

研究机构
东北大学
论文信息
作者 Qihua Dong, Kuo Yang, Lin Ju, Handong Zhao, Yitian Zhang et al.
发布日期 2026-02-27
arXiv ID 2602.23898
相关性评分 9/10 (高度相关)