摘要
3D 场景图为机器人提供了结构化的物体实体及关系表示,支持高层解释与推理。现有方法通常结合场景重建与图神经网络,但依赖多模态数据且受限于启发式构建。本文提出 SGR3 模型,一种无需训练的框架,利用多模态大语言模型结合检索增强生成技术生成语义场景图。该模型绕过显式 3D 重建,通过 ColPali 风格跨模态框架检索语义对齐的场景图以增强关系推理,并引入加权补丁级相似性选择机制提升鲁棒性。实验表明其性能媲美基于 GNN 的专家模型。
AI 推荐理由
论文核心在于利用 MLLM 进行 3D 场景图的关系推理,无需训练即可实现高级语义理解。
研究机构
清华大学
德国卡尔斯鲁厄理工学院
论文信息