摘要
本文探讨多模态大语言模型(MLLM)在积木组装任务中的视觉 grounding 与空间推理能力。针对现有模型在细粒度选择与姿态估计上的不足,提出 Brick-Composer 学习框架。该框架融合人类设计启发、世界反馈及合成经验三种信号,有效增强模型的组装技能。实验表明,该方法将积木选择准确率提升三倍,严格步骤成功率从不足 1% 增至约 15%,证明 MLLM 可通过针对性物理 grounding 学习获得复杂组装能力。
AI 推荐理由
论文核心在于通过新框架赋予 MLLM 积木组装技能,显著提升工具使用与操作能力。
研究机构
UIUC
Stevens Institute of Technology
Northwestern University
论文信息