Visual Reasoning Benchmark Geoscience Multimodal Models
摘要

地学智能旨在理解并预测地球系统变化以支持关键决策。现有研究虽在特定任务上取得进展,但缺乏能捕捉开放性地学问题的基准。为此,本文提出 GeoR-Bench,一个通过推理驱动的视觉编辑任务来评估地学视觉推理的基准。该基准涵盖 6 大类、24 种任务类型共 440 个样本。对 21 个多模态模型的评估显示,地学推理仍是主要瓶颈:最佳模型严格准确率仅 42.7%,开源模型仅为 10.3%。结果表明,当前模型生成的结果虽具表面合理性,却未能掌握潜在的地球科学过程。

AI 推荐理由

论文核心是构建评估地学视觉推理能力的基准,直接聚焦于多模态模型的推理瓶颈与科学准确性。

研究机构
上海交通大学 北京科技大学
论文信息
作者 Yushuo Zheng, Zicheng Zhang, Huiyu Duan, Chunyi Li, Zijian Chen et al.
发布日期 2026-05-12
arXiv ID 2605.11541
相关性评分 9/10 (高度相关)