多模态大语言模型 科学图像分析 基准测试 专家级推理
摘要

本文介绍了 SPUR,一个涵盖科学实验图像感知、理解与推理的综合基准,包含源自 1084 张专家精选图像的 4264 个问答对。SPUR 具有三大创新:面板级细粒度感知评估、跨面板关系理解以及专家级推理评估。通过对 20 个多模态大语言模型及四种多模态思维链方法的全面评估,研究发现当前模型在科学图像解读方面显著未达到专家水平,揭示了人工智能用于科学(AI4S)研究的关键瓶颈。

AI 推荐理由

论文核心评估多模态模型在科学图像中的专家级推理能力,直接对应推理主题。

研究机构
Beijing University of Posts and Telecommunications
论文信息
作者 Junpeng Ding, Zichen Tang, Haihong E, Mengyuan Ji, Yang Liu et al.
发布日期 2026-04-30
arXiv ID 2604.27604
相关性评分 9/10 (高度相关)