Embodied AI Vision-Language Models Task Planning Reinforcement Learning
摘要

针对现有视觉 - 语言模型在具身智能体环境中理解不足的问题,本文提出环境理解具身智能体框架。该框架微调对象感知、任务规划、动作理解及目标识别四项核心技能,并引入利用这些技能的恢复步骤及优化不一致预测的群体相对策略优化阶段。实验表明,该方法在 ALFRED 任务上显著优于行为克隆基线,平均成功率提升 8.86%,后续优化阶段再增益 3.03%,有效增强了指令跟随的可靠性。

AI 推荐理由

论文核心提出任务规划技能及恢复机制,通过细化子目标生成提升智能体环境理解与执行成功率。

研究机构
UNIST
论文信息
作者 Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim
发布日期 2026-04-21
arXiv ID 2604.19839
相关性评分 9/10 (高度相关)