VLM 物理推理 守恒律 基准测试
摘要

理解物理变换是动态环境推理的基础。尽管视觉语言模型(VLM)在具身应用中展现出潜力,但其是否真正理解物理变换尚不明确。本文引入 ConservationBench 基准,通过成对的守恒与非守恒场景,评估模型对物理量不变性的理解。在 112 个 VLM 上进行的 23,040 次测试显示,模型表现系统性失败,准确率接近随机猜测。控制实验表明,模型虽存在倾向于不变性的文本先验,但加入视觉内容后表现反而更差。结果表明,当前 VLM 无法在动态场景中维持物理属性的变换不变性表征。

AI 推荐理由

论文核心评估 VLM 对物理变换的推理能力,揭示其缺乏守恒概念,属推理机制研究。

研究机构
加州大学圣地亚哥分校 密歇根大学 多伦多大学
论文信息
作者 Dezhi Luo, Yijiang Li, Maijunxian Wang, Tianwei Zhao, Bingyang Wang et al.
发布日期 2026-03-07
arXiv ID 2603.07109
相关性评分 9/10 (高度相关)