Multi-Agent System 3D Understanding Task Planning Grounded Reasoning
摘要

视觉语言模型在多模态理解中表现优异,但 3D 场景中的具身推理仍待探索。有效 3D 推理依赖精准定位:需先识别相关对象与区域,再推导其空间几何关系。现有方法常依赖特定领域训练或手工流程,限制了灵活性。本文提出 MAG-3D,一种无需训练的多智能体框架,利用现成视觉语言模型进行具身 3D 推理。该框架动态协调专家智能体:规划智能体分解任务并统筹全局,定位智能体执行自由形式 3D 定位与帧检索,编码智能体通过可执行程序进行灵活几何推理与验证。

AI 推荐理由

论文提出多智能体框架,核心是规划智能体分解任务并协调推理过程,属规划机制研究。

研究机构
清华大学
论文信息
作者 Henry Zheng, Chenyue Fang, Rui Huang, Siyuan Wei, Xiao Liu et al.
发布日期 2026-04-10
arXiv ID 2604.09167
相关性评分 9/10 (高度相关)