3D Reconstruction Spatial Memory VLM Domain-Specific Language
摘要

视觉语言模型(VLM)虽具备初步空间推理能力,但在视角推理等精确任务中仍不可靠。针对多视图图像中空间线索稀疏分散的问题,本文提出 Reasmory 框架。该框架构建显式 3D 记忆(如点云),并引入轻量级领域特定语言(DSL)约束 VLM 对记忆的查询与操作。通过将推理转化为基于重建记忆的结构化程序执行,避免了自由形式工具调用的脆弱性。实验表明,该方法在多个基准上显著优于现有强基线模型。

AI 推荐理由

论文核心提出显式 3D 记忆架构,通过结构化程序执行增强空间推理,属记忆机制研究。

研究机构
Cornell Tech, Cornell University NVIDIA illica AI The University of California, Merced
论文信息
作者 Jixuan He, Xueting Li, Chieh Hubert Lin, Ming-Hsuan Yang
发布日期 2026-05-31
arXiv ID 2606.00963
相关性评分 9/10 (高度相关)