Co-Evolution Robotics Data Efficiency Continual Learning Simulator
摘要

针对机器人操作缺乏任务对齐物理数据的问题,本文提出 RoboEvolve 框架。该框架将视觉语言模型规划器与视频生成模拟器耦合,形成相互强化的共进化循环。系统利用认知启发的双阶段机制:白天探索通过语义控制奖励发现物理行为,夜间巩固挖掘“惜败”案例以稳定策略优化。在自主渐进课程指导下,系统能从简单动作扩展至复杂任务。实验表明,该方法在数据效率上超越全监督基线五十倍,并展现出无灾难性遗忘的持续学习能力。

AI 推荐理由

论文核心提出共进化框架,通过昼夜双阶段机制实现规划器与模拟器的自我迭代与持续改进。

研究机构
The Hong Kong University of Science and Technology (Guangzhou)
论文信息
作者 Harold Haodong Chen, Sirui Chen, Yingjie Xu, Wenhang Ge, Ying-Cong Chen
发布日期 2026-05-13
arXiv ID 2605.13775
相关性评分 9/10 (高度相关)