摘要
多模态大语言模型(MLLMs)擅长识别独立视觉元素及简单线性图推理,但在处理涉及分支、汇聚流及循环依赖的复杂拓扑结构时,其推理能力显著下降。现有基准多关注语义理解而忽视结构推理。本文提出 ReactBench,利用涵盖从线性链到循环图多样结构的化学反应图,揭示 MLLM 在结构推理上的根本局限。该基准包含 1618 个专家标注的问答对。对 17 个模型的评估显示,基于锚点的任务与整体结构推理任务之间存在超过 30% 的性能差距,消融实验证实该瓶颈源于推理能力不足。
AI 推荐理由
论文核心评估 MLLM 在复杂拓扑结构上的推理能力,明确瓶颈在于推理而非感知。
研究机构
International Digital Economy Academy, Shenzhen, China
University of Wisconsin-Madison
论文信息