摘要
人类第一人称视频捕捉了丰富的操作演示,但因人与机器人在视觉外观和运动学上的具身差异,技能迁移极具挑战。本文提出 HumanEgo 框架,通过将人类演示提升为手 - 物体交互的实体级表示,并利用密集辅助目标训练流匹配策略,从而弥合具身差距。该方法无需机器人数据、硬件无关且数据高效,仅需每任务 30 分钟人类视频即可在四项真实任务中实现 92.5% 的平均成功率,显著优于同等时长的机器人遥操作,并能鲁棒地零样本迁移至新型机器人、相机及环境。
AI 推荐理由
论文核心在于从人类视频中提取操作技能并零样本迁移至机器人,属于典型的技能学习与迁移研究。
研究机构
University of Maryland
论文信息