摘要
尽管多模态大语言模型进展显著,但因依赖 2D 视觉先验,其在复杂 3D 空间推理上仍表现不佳。现有方法要么计算昂贵,要么缺乏几何理解。为此,本文提出一种无需训练的框架,引入基于显式 3D 重建的视觉思维链机制。该流程首先从单张图像重建高保真 3D 网格,随后利用外部知识库迭代计算最佳相机参数并合成新视角,模拟人类视角转换。实验表明,该方法在 3DSRBench 等基准上显著优于专用空间模型及通用大模型,大幅提升了空间理解能力。
AI 推荐理由
论文核心提出视觉思维链机制,旨在解决多模态大模型在复杂 3D 空间推理上的缺陷。
研究机构
清华大学
南京大学
腾讯
论文信息