摘要
现有多模态大模型在 3D 空间推理方面表现不佳,难以构建视频输入中 3D 环境的结构化抽象。受自我中心空间推理认知理论启发,本文研究了如何使模型对视频的文本化空间表征进行建模与推理。我们提出了 TRACE 方法,诱导模型生成基于文本的 3D 环境表征作为中间推理轨迹,以提升空间问答准确性。该方法编码了元上下文、相机轨迹及详细物体实体。在 VSI-Bench 和 OST-Bench 上的实验表明,TRACE 在不同参数规模和训练方案的多种模型骨干上均显著优于现有提示策略。
AI 推荐理由
论文核心在于通过文本表征引导多模态大模型进行 3D 空间推理,直接提升推理能力。
研究机构
1 College of AI, Tsinghua University
2 Shanghai Artificial Intelligence Laboratory
3 The University of Tokyo
论文信息