空间智能 测试时训练 视频理解 动态记忆 快权重
摘要

人类通过连续视觉观察感知现实空间,因此从无限视频流中流式维护和更新空间证据对空间智能至关重要。本文提出 Spatial-TTT,利用测试时训练(TTT)自适应调整部分参数(快权重),以捕获并组织长时段场景视频中的空间证据。该方法设计了混合架构,结合大块更新与滑动窗口注意力机制以实现高效处理;并引入带有 3D 时空卷积的空间预测机制,增强几何对应与时序连续性捕捉能力。此外,构建了含密集 3D 空间描述的数据集,引导模型结构化地记忆全局空间信号。实验表明其在视频空间基准上达到最先进水平。

AI 推荐理由

论文核心在于通过测试时训练动态更新参数以长期组织和保留空间证据,本质是记忆机制研究。

研究机构
清华大学 腾讯混元
论文信息
作者 Fangfu Liu, Diankun Wu, Jiawei Chi, Yimo Cai, Yi-Hsin Hung et al.
发布日期 2026-03-12
arXiv ID 2603.12255
相关性评分 9/10 (高度相关)