Skill Transfer Imitation Learning Robotics Egocentric Vision
摘要

人类第一人称视频捕捉了丰富的操作演示,但因人与机器人在视觉外观和运动学上的具身差异,技能迁移极具挑战。本文提出 HumanEgo 框架,通过将人类演示提升为手 - 物体交互的实体级表示,并利用密集辅助目标训练流匹配策略,从而弥合具身差距。该方法无需机器人数据、硬件无关且数据高效,仅需每任务 30 分钟人类视频即可在四项真实任务中实现 92.5% 的平均成功率,显著优于同等时长的机器人遥操作,并能鲁棒地零样本迁移至新型机器人、相机及环境。

AI 推荐理由

论文核心在于从人类视频中提取操作技能并零样本迁移至机器人,属于典型的技能学习与迁移研究。

研究机构
University of Maryland
论文信息
作者 Zhi, Wang, Botao He, Kelin Yu, Seungjae Lee et al.
发布日期 2026-05-24
arXiv ID 2605.24934
相关性评分 9/10 (高度相关)