多模态大语言模型 物理推理 基准测试 费曼图 科学发现
摘要

前沿理论突破常依赖具体图示符号与严谨逻辑的结合。尽管多模态大语言模型在科学任务中展现潜力,现有基准多关注局部信息提取,忽视形式化科学符号中的全局结构逻辑。本文提出 FeynmanBench,首个聚焦费曼图任务的基准,旨在评估 AI 的多步图示推理能力,包括满足守恒律与对称约束、识别图拓扑、转换图示与代数表示及构建散射振幅。我们开发了自动化流水线生成多样化费曼图及可验证标注,涵盖标准模型三种相互作用、超 100 种类型及 2000 多个任务。实验揭示当前模型在物理约束执行与全局拓扑条件上的系统性缺陷,强调了基于物理的视觉推理基准的必要性。

AI 推荐理由

论文核心评估多模态模型在物理图示中的多步逻辑推理与结构理解能力。

研究机构
Alibaba Group Beijing, China Skylenage
论文信息
作者 Zeyu Wang, Xiaogang Li, Peiyao Xiao, Qinhao Kong, Ben Wang et al.
发布日期 2026-04-04
arXiv ID 2604.03893
相关性评分 9/10 (高度相关)