摘要
上下文模仿学习使机器人能从演示中获取技能,但单次轨迹生成在环境变化下表现脆弱。本文提出 SAIL 框架,将机器人模仿重构为可随测试时计算扩展的迭代优化问题。该框架利用蒙特卡洛树搜索,以完整轨迹为节点、轨迹优化为边,并通过成功轨迹档案检索、基于视觉语言模型的评分机制及步级反馈引导优化。实验表明,增加测试时计算能显著提升复杂任务成功率,最高达 95%,证明了轨迹级测试时扩展是通往通用机器人代理的稳健路径。
AI 推荐理由
论文核心研究机器人通过上下文模仿学习获取技能,利用测试时计算扩展提升技能鲁棒性。
研究机构
日本国立研究开发法人产业技术综合研究所
论文信息