摘要
指代表达理解(REC)旨在将语言与区域级视觉感知相连接。尽管现有基准在多模态大模型推动下进展迅速,但在测试视觉推理和定位能力方面仍显不足:表达过短、干扰项少及描述冗余导致模型可利用捷径而非真正推理。为此,本文提出 Ref-Adv,一个现代 REC 基准,通过配对语言复杂的表达与仅含必要信息的图像来抑制捷径。该数据集包含真实图像上的指代表达,精心设计了困难干扰项,并标注了包括否定在内的推理要素。实验表明,当代多模态大模型在 Ref-Adv 上表现显著下降,暴露了其对捷径的依赖及视觉推理能力的缺失。
AI 推荐理由
论文核心在于评估和提升多模态大模型的视觉推理与 grounding 能力,通过构建新基准揭示现有模型的推理缺陷。
研究机构
东北大学
论文信息