Scientific Reasoning Multimodal Benchmark MLLM Evaluation
摘要

科学推理是人类智能的关键,需整合多模态输入、领域专家知识及跨学科多步推断。现有基准常无法捕捉严谨评估所需的推理复杂性与可追溯性。为此,本文提出 SciVQR,一个涵盖数学、物理等 54 个子领域的多模态基准。该基准包含方程、图表等专业视觉内容,挑战模型结合视觉理解与推理的能力。任务从基础事实回忆到复杂多步推断不等,且 46% 配有专家撰写解答。SciVQR 不仅评估最终答案,更考察推理过程。对主流多模态大模型的评估揭示了其在处理复杂多模态推理任务上的显著局限。

AI 推荐理由

论文核心在于评估多模态科学推理能力,涵盖多步推断与跨学科知识整合。

研究机构
中国科学院自动化研究所 (CASIA) 中国科学院大学人工智能学院 OPPO AI Center
论文信息
作者 Longteng Guo, Xuanxu Lin, Dongze Hao, Tongtian Yue, Pengkang Huo et al.
发布日期 2026-05-11
arXiv ID 2605.10187
相关性评分 9/10 (高度相关)