VLM Logical Reasoning Benchmark Physics Puzzle Visual Grounding
摘要

视觉语言(动作)模型日益应用于交互环境,但现有基准常忽视点击式谜题游戏所需的复杂物理推理。本文提出 VLATIM 基准,基于经典物理游戏《不可思议的机器 2》,旨在评估类人逻辑问题解决能力。该基准填补了高层逻辑推理与需精确鼠标操作的连续动作空间之间的空白,包含五个渐进部分,涵盖从基础视觉定位到完整谜题求解的能力。结果显示推理与执行存在显著差距:大型专有模型虽具优越规划能力,但在精确视觉定位上表现不佳,尚未展现类人问题解决能力。

AI 推荐理由

论文核心评估 VLM 在物理谜题中的逻辑推理与问题解决能力,虽涉及规划但侧重推理差距分析。

研究机构
Institute of Artificial Intelligence, University of Stuttgart, Germany
论文信息
作者 Dominik Helfenstein, Marco Menner, Maximilian Triebel
发布日期 2026-05-11
arXiv ID 2605.11223
相关性评分 8/10 (高度相关)