robotic manipulation skill composition cross-task generalization in-context learning
摘要

跨任务泛化是开放世界机器人操作的核心挑战,关键在于从已见任务中提取可迁移的操作知识。现有的上下文学习方法仅提供低层连续动作序列,无法捕捉可组合的技能知识,导致模型退化为表面轨迹模仿。本文提出“分解与重组”框架,利用原子技能 - 动作对作为中间表示,将演示分解为可解释的对齐关系,使模型能通过组合推理为新任务重组技能。该方法构建了结合视觉语义检索与规划代理技能序列的动态演示库,并辅以覆盖感知的静态库,显著提升了零样本跨任务泛化能力。

AI 推荐理由

论文核心提出基于原子技能 - 动作对的推理框架,解决技能组合与跨任务泛化问题。

研究机构
School of Artificial Intelligence, College of Intelligence and Computing, Tianjin University, China
论文信息
作者 Xitie Zhang, Aming Wu, Yahong Han
发布日期 2026-05-02
arXiv ID 2605.01448
相关性评分 9/10 (高度相关)