MLLM Robotics Skill Learning Visual Grounding Assembly
摘要

本文探讨多模态大语言模型(MLLM)在积木组装任务中的视觉 grounding 与空间推理能力。针对现有模型在细粒度选择与姿态估计上的不足,提出 Brick-Composer 学习框架。该框架融合人类设计启发、世界反馈及合成经验三种信号,有效增强模型的组装技能。实验表明,该方法将积木选择准确率提升三倍,严格步骤成功率从不足 1% 增至约 15%,证明 MLLM 可通过针对性物理 grounding 学习获得复杂组装能力。

AI 推荐理由

论文核心在于通过新框架赋予 MLLM 积木组装技能,显著提升工具使用与操作能力。

研究机构
UIUC Stevens Institute of Technology Northwestern University
论文信息
作者 Jiateng Liu, Bingxuan Li, Zhenhailong Wang, Rushi Wang, Kaiwen Hong et al.
发布日期 2026-06-03
arXiv ID 2606.05445
相关性评分 9/10 (高度相关)