摘要
近期多模态大语言模型(MLLMs)在视觉推理基准上表现优异,但其性能在多大程度上反映了基于视觉证据的直接推理尚不明确。本文推出 VisReason,这是一个针对日常场景中感知与推断紧密耦合的以视觉为中心的推理基准。该基准包含跨越感知、结构和概念推理的 10 个类别共 1505 个问题。评估表明,VisReason 提出了与现有基准性质不同的挑战,揭示了人类与当前 MLMs 之间的巨大差距,并显示测试时推理策略收益有限。VisReason 为评估超越语言的视觉中心推理提供了专注的诊断工具。
AI 推荐理由
论文核心聚焦于多模态大模型的视觉推理能力评估,提出新基准并深入分析推理差距。
研究机构
中国科学院自动化研究所
中国科学院人工智能创新研究院
论文信息