4D reasoning dynamic spatial understanding vision-language models latent mental imagery reinforcement learning
摘要

单目视频的动态空间推理是连接视觉智能与物理世界的关键,但对视觉语言模型极具挑战。现有方法要么将时空推理完全文本化导致冗长不精确,要么依赖外部几何模块增加复杂度。本文提出 4DThinker,首个让模型通过动态潜在心理意象“用 4D 思考”的框架,即在连续隐藏空间内模拟场景演化。我们引入了无需标注的数据生成流水线,并提出动态意象微调(DIFT)联合监督文本与 4D 潜变量。此外,基于结果的 4D 强化学习(4DRL)进一步优化复杂推理任务。实验表明该方法在多个基准上显著优于现有基线。

AI 推荐理由

论文核心提出动态空间推理框架,通过 4D 潜在意象增强模型内在推理能力。

研究机构
清华大学 新加坡国立大学 香港中文大学 加州大学洛杉矶分校
论文信息
作者 Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xiang An, Bo Li et al.
发布日期 2026-05-07
arXiv ID 2605.05997
相关性评分 9/10 (高度相关)