摘要
长程具身任务因依赖人工奖励或标注数据而难以扩展。本文提出 ASH,一种能从无标签网络视频中学习具身策略的自我改进系统。ASH 在受阻时利用自身轨迹训练逆动力学模型,从中提取监督信号,并通过无监督学习识别关键帧作为长期记忆以解决长程问题。在宝可梦和塞尔达传说游戏中,ASH 持续进步并显著超越现有基线,证明了自我进化智能体在长程具身学习中的可扩展性。
AI 推荐理由
论文核心提出自我改进循环,利用自身轨迹学习逆动力学模型以实现策略自进化。
研究机构
University of Waterloo
National Research Council Canada
论文信息