3D 空间推理 多模态大语言模型 几何表示 零样本学习
摘要

尽管多模态大语言模型(MLLMs)在 2D 视觉理解上成效显著,但其 3D 空间推理能力仍受限。为此,本文提出几何参考 3D 场景表示(GR3D),通过为图像中的对象标注唯一 ID 并将其 3D 几何属性编码为文本引用,使 MLLM 能结合语言推理技能解析 3D 线索。该方法无需额外训练,在零样本设置下将 GPT-5 在 VSI-Bench 上的整体性能提升 8%,空间布局相关任务提升超 11%,显著增强了稀疏视角下的复杂空间推理能力。

AI 推荐理由

论文核心在于通过几何表示增强 MLLM 的 3D 空间推理能力,直接提升逻辑与数学推理表现。

研究机构
Zillow Group
论文信息
作者 Jiangye Yuan, Gowri Kumar, Baoyuan Wang
发布日期 2026-03-09
arXiv ID 2603.08592
相关性评分 9/10 (高度相关)