摘要
本文提出 CaP-X 框架,旨在系统研究机器人操作中的“代码即策略”代理。核心组件 CaP-Gym 允许代理通过合成和执行程序来控制机器人。评估显示,模型性能依赖人工抽象,但通过扩展测试时计算(如多轮交互、结构化反馈及自动技能合成)可显著缓解此问题并提升鲁棒性。由此衍生的 CaP-Agent0 在无训练情况下实现了人类级别的可靠性,而 CaP-RL 则利用强化学习进一步提高了成功率并实现了高效的仿真到现实迁移。
AI 推荐理由
论文核心研究代码生成策略及自动技能合成,属于典型的技能学习与工具使用范畴。
研究机构
清华大学
斯坦福大学
加州大学伯克利分校
论文信息