Robot Learning Skill Composition Vision-Language-Action Imitation Learning
摘要

使机器人理解并执行自然语言指令同时保持数据效率极具挑战。基础模型交互直观但需大量数据,而任务参数化模仿学习数据高效却缺乏语言 grounding。本文提出模块化架构,结合任务参数化核运动原语与预训练视觉语言模型。系统仅需少量演示即可获取技能,由模型生成技能模式;执行时解析指令以选择技能、推理参数绑定并通过协方差加权组合创造新行为。若能力不足,系统主动请求针对性演示无需微调。实验显示在技能选择与组合场景中成功率达 73.3%-100%。

AI 推荐理由

论文核心研究基于自然语言的机器人技能选择、参数绑定及组合机制,属技能学习范畴。

研究机构
German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMK), Münchner Str. 20, 82347 Weßling, Germany School of Computation, Information and Technology (CIT), Technical University of Munich (TUM), Arcisstr. 21, 80333 Munich, Germany
论文信息
作者 Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer et al.
发布日期 2026-06-06
arXiv ID 2606.08169
相关性评分 9/10 (高度相关)