Physical Reasoning Vision-Language Models Knowledge Consolidation Spatio-Temporal Consistency
摘要

视觉语言模型在处理教科书式物理问题时表现优异,但在需要跨帧时间一致性和因果推理的动态现实场景中常告失败。本文指出两大根本挑战:时空身份漂移导致因果链断裂,以及推理时洞察的易失性阻碍知识复用。为此,我们提出 PhysNote 代理框架,通过自生成的“知识笔记”外化并精炼物理知识。该框架利用时空规范化稳定动态感知,将洞察组织为分层知识库,并驱动迭代推理循环,在巩固已验证知识前将假设锚定于视觉证据。实验表明,PhysNote 在 PhysBench 上准确率达 56.68%,显著优于现有基线。

AI 推荐理由

论文核心解决视觉语言模型在动态场景中的时空一致性与因果推理失败问题,提出增强物理推理能力的框架。

研究机构
The Chinese University of Hong Kong Rice University City University of Hong Kong Fudan University
论文信息
作者 Sinin Zhang, Yunfei Xie, Yuxuan Cheng, Haoyu Zhang, Tong Zhang
发布日期 2026-04-27
arXiv ID 2604.24443
相关性评分 9/10 (高度相关)