MLLM Topology Reasoning Benchmark Chemical Diagrams
摘要

多模态大语言模型(MLLMs)擅长识别独立视觉元素及简单线性图推理,但在处理涉及分支、汇聚流及循环依赖的复杂拓扑结构时,其推理能力显著下降。现有基准多关注语义理解而忽视结构推理。本文提出 ReactBench,利用涵盖从线性链到循环图多样结构的化学反应图,揭示 MLLM 在结构推理上的根本局限。该基准包含 1618 个专家标注的问答对。对 17 个模型的评估显示,基于锚点的任务与整体结构推理任务之间存在超过 30% 的性能差距,消融实验证实该瓶颈源于推理能力不足。

AI 推荐理由

论文核心评估 MLLM 在复杂拓扑结构上的推理能力,明确瓶颈在于推理而非感知。

研究机构
International Digital Economy Academy, Shenzhen, China University of Wisconsin-Madison
论文信息
作者 Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen et al.
发布日期 2026-04-17
arXiv ID 2604.15994
相关性评分 9/10 (高度相关)