摘要
针对机器人操作缺乏任务对齐物理数据的问题,本文提出 RoboEvolve 框架。该框架将视觉语言模型规划器与视频生成模拟器耦合,形成相互强化的共进化循环。系统利用认知启发的双阶段机制:白天探索通过语义控制奖励发现物理行为,夜间巩固挖掘“惜败”案例以稳定策略优化。在自主渐进课程指导下,系统能从简单动作扩展至复杂任务。实验表明,该方法在数据效率上超越全监督基线五十倍,并展现出无灾难性遗忘的持续学习能力。
AI 推荐理由
论文核心提出共进化框架,通过昼夜双阶段机制实现规划器与模拟器的自我迭代与持续改进。
研究机构
The Hong Kong University of Science and Technology (Guangzhou)
论文信息