Embodied AI Test-Time Planning Reflection Robotics
摘要

具身大语言模型虽具备高层任务推理能力,但缺乏对错误的反思机制,导致部署中错误重复而非积累经验。本文受人类反思实践启发,提出反思性测试时规划方法,整合两种反思模式:行动中的反思利用测试时缩放生成并评分候选动作;行动后的反思通过测试时训练更新内部模型与策略。此外,引入回溯反思以重新评估早期决策,实现长视野信用分配。实验表明该方法在长程家庭任务及 MuJoCo 基准上显著优于基线。

AI 推荐理由

论文核心提出反思性测试时规划框架,通过行动中与行动后反思优化任务规划。

研究机构
中国科学院 斯坦福大学 华盛顿大学
论文信息
作者 Yining Hong, Huang Huang, Manling Li, Li Fei-Fei, Jiajun Wu et al.
发布日期 2026-02-24
arXiv ID 2602.21198
相关性评分 9/10 (高度相关)