3D Scene Graph Retrieval-Augmented Generation Multimodal LLM Relational Reasoning
摘要

3D 场景图为机器人提供了结构化的物体实体及关系表示,支持高层解释与推理。现有方法通常结合场景重建与图神经网络,但依赖多模态数据且受限于启发式构建。本文提出 SGR3 模型,一种无需训练的框架,利用多模态大语言模型结合检索增强生成技术生成语义场景图。该模型绕过显式 3D 重建,通过 ColPali 风格跨模态框架检索语义对齐的场景图以增强关系推理,并引入加权补丁级相似性选择机制提升鲁棒性。实验表明其性能媲美基于 GNN 的专家模型。

AI 推荐理由

论文核心在于利用 MLLM 进行 3D 场景图的关系推理,无需训练即可实现高级语义理解。

研究机构
清华大学 德国卡尔斯鲁厄理工学院
论文信息
作者 Zirui Wang, Ruiping Liu, Yufan Chen, Junwei Zheng, Weijia Fan et al.
发布日期 2026-03-04
arXiv ID 2603.04614
相关性评分 9/10 (高度相关)