Imitation Learning Test-Time Scaling Robotics VLM Monte Carlo Tree Search
摘要

上下文模仿学习使机器人能从演示中获取技能,但单次轨迹生成在环境变化下表现脆弱。本文提出 SAIL 框架,将机器人模仿重构为可随测试时计算扩展的迭代优化问题。该框架利用蒙特卡洛树搜索,以完整轨迹为节点、轨迹优化为边,并通过成功轨迹档案检索、基于视觉语言模型的评分机制及步级反馈引导优化。实验表明,增加测试时计算能显著提升复杂任务成功率,最高达 95%,证明了轨迹级测试时扩展是通往通用机器人代理的稳健路径。

AI 推荐理由

论文核心研究机器人通过上下文模仿学习获取技能,利用测试时计算扩展提升技能鲁棒性。

研究机构
日本国立研究开发法人产业技术综合研究所
论文信息
作者 Makoto Sato, Yusuke Iwasawa, Yujin Tang, So Kuroki
发布日期 2026-03-09
arXiv ID 2603.08269
相关性评分 9/10 (高度相关)