Self-Improvement Embodied AI Unsupervised Learning Long-Horizon Tasks
摘要

长程具身任务因依赖人工奖励或标注数据而难以扩展。本文提出 ASH,一种能从无标签网络视频中学习具身策略的自我改进系统。ASH 在受阻时利用自身轨迹训练逆动力学模型,从中提取监督信号,并通过无监督学习识别关键帧作为长期记忆以解决长程问题。在宝可梦和塞尔达传说游戏中,ASH 持续进步并显著超越现有基线,证明了自我进化智能体在长程具身学习中的可扩展性。

AI 推荐理由

论文核心提出自我改进循环,利用自身轨迹学习逆动力学模型以实现策略自进化。

研究机构
University of Waterloo National Research Council Canada
论文信息
作者 Benjamin Schneider, Xavier Schneider, Victor Zhong, Sun Sun
发布日期 2026-05-14
arXiv ID 2605.14211
相关性评分 9/10 (高度相关)