摘要
视觉语言模型在多模态理解中表现优异,但 3D 场景中的具身推理仍待探索。有效 3D 推理依赖精准定位:需先识别相关对象与区域,再推导其空间几何关系。现有方法常依赖特定领域训练或手工流程,限制了灵活性。本文提出 MAG-3D,一种无需训练的多智能体框架,利用现成视觉语言模型进行具身 3D 推理。该框架动态协调专家智能体:规划智能体分解任务并统筹全局,定位智能体执行自由形式 3D 定位与帧检索,编码智能体通过可执行程序进行灵活几何推理与验证。
AI 推荐理由
论文提出多智能体框架,核心是规划智能体分解任务并协调推理过程,属规划机制研究。
研究机构
清华大学
论文信息