摘要
单目视频的动态空间推理是连接视觉智能与物理世界的关键,但对视觉语言模型极具挑战。现有方法要么将时空推理完全文本化导致冗长不精确,要么依赖外部几何模块增加复杂度。本文提出 4DThinker,首个让模型通过动态潜在心理意象“用 4D 思考”的框架,即在连续隐藏空间内模拟场景演化。我们引入了无需标注的数据生成流水线,并提出动态意象微调(DIFT)联合监督文本与 4D 潜变量。此外,基于结果的 4D 强化学习(4DRL)进一步优化复杂推理任务。实验表明该方法在多个基准上显著优于现有基线。
AI 推荐理由
论文核心提出动态空间推理框架,通过 4D 潜在意象增强模型内在推理能力。
研究机构
清华大学
新加坡国立大学
香港中文大学
加州大学洛杉矶分校
论文信息