摘要
尽管多模态大语言模型(MLLMs)在 2D 视觉理解上成效显著,但其 3D 空间推理能力仍受限。为此,本文提出几何参考 3D 场景表示(GR3D),通过为图像中的对象标注唯一 ID 并将其 3D 几何属性编码为文本引用,使 MLLM 能结合语言推理技能解析 3D 线索。该方法无需额外训练,在零样本设置下将 GPT-5 在 VSI-Bench 上的整体性能提升 8%,空间布局相关任务提升超 11%,显著增强了稀疏视角下的复杂空间推理能力。
AI 推荐理由
论文核心在于通过几何表示增强 MLLM 的 3D 空间推理能力,直接提升逻辑与数学推理表现。
研究机构
Zillow Group
论文信息