Multimodal Reasoning Benchmark MLLM Evaluation
摘要

尽管多模态大语言模型(MLLMs)在科学分析和数学推理等复杂任务中展现出潜力,但其在真实生活场景中的跨情境推理能力仍缺乏系统探索与标准化评估。为此,本文提出 MMR-Life,一个涵盖七类推理类型( abduction、类比、因果、演绎、归纳、空间及时间)的综合基准,包含基于 19,108 张真实世界图像的 2,646 道选择题。对 37 个先进模型的评估显示,即使是最顶尖模型准确率也仅为 58%,且在不同推理类型上表现差异显著。本研究为下一代多模态推理系统的评估与改进奠定了坚实基础。

AI 推荐理由

论文提出多模态推理基准,核心评估多种推理能力,直接针对推理主题。

研究机构
中国科学院自动化研究所 中国科学院大学人工智能学院
论文信息
作者 Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao et al.
发布日期 2026-03-02
arXiv ID 2603.02024
相关性评分 9/10 (高度相关)