摘要
视觉语言模型(VLM)虽具备初步空间推理能力,但在视角推理等精确任务中仍不可靠。针对多视图图像中空间线索稀疏分散的问题,本文提出 Reasmory 框架。该框架构建显式 3D 记忆(如点云),并引入轻量级领域特定语言(DSL)约束 VLM 对记忆的查询与操作。通过将推理转化为基于重建记忆的结构化程序执行,避免了自由形式工具调用的脆弱性。实验表明,该方法在多个基准上显著优于现有强基线模型。
AI 推荐理由
论文核心提出显式 3D 记忆架构,通过结构化程序执行增强空间推理,属记忆机制研究。
研究机构
Cornell Tech, Cornell University
NVIDIA
illica AI
The University of California, Merced
论文信息