摘要
具身大语言模型虽具备高层任务推理能力,但缺乏对错误的反思机制,导致部署中错误重复而非积累经验。本文受人类反思实践启发,提出反思性测试时规划方法,整合两种反思模式:行动中的反思利用测试时缩放生成并评分候选动作;行动后的反思通过测试时训练更新内部模型与策略。此外,引入回溯反思以重新评估早期决策,实现长视野信用分配。实验表明该方法在长程家庭任务及 MuJoCo 基准上显著优于基线。
AI 推荐理由
论文核心提出反思性测试时规划框架,通过行动中与行动后反思优化任务规划。
研究机构
中国科学院
斯坦福大学
华盛顿大学
论文信息