摘要
本文介绍了 SPUR,一个涵盖科学实验图像感知、理解与推理的综合基准,包含源自 1084 张专家精选图像的 4264 个问答对。SPUR 具有三大创新:面板级细粒度感知评估、跨面板关系理解以及专家级推理评估。通过对 20 个多模态大语言模型及四种多模态思维链方法的全面评估,研究发现当前模型在科学图像解读方面显著未达到专家水平,揭示了人工智能用于科学(AI4S)研究的关键瓶颈。
AI 推荐理由
论文核心评估多模态模型在科学图像中的专家级推理能力,直接对应推理主题。
研究机构
Beijing University of Posts and Telecommunications
论文信息