embodied agents evaluation framework task termination goal completion
摘要

标准具身评估未独立评分智能体在 episode 结束时是否正确承诺任务完成(即终端承诺)。行为各异的失败类型被混淆为同一基准失败。本文提出 VIGIL 评估框架,使终端承诺可独立度量。在该协议下,智能体仅观察第一人称 RGB 图像,无动作成功信号,须以语义报告结束 episode,并针对隐藏世界状态进行确定性校验。此举分离出世界状态完成度与基准成功率两个指标,区分四类结果。实验表明,执行能力相近的模型在终端报告生成上差异显著,揭示了规划中终止决策的独立性。

AI 推荐理由

论文核心研究智能体任务完成判定与终止决策,属于目标导向行为规划的关键环节。

研究机构
XPENG Robotics The Hong Kong Polytechnic University
论文信息
作者 Ying Chen, Rui Jiang, Lihuang Fang, Mingxu Wang, Zhifeng Gu et al.
发布日期 2026-05-09
arXiv ID 2605.08747
相关性评分 8/10 (高度相关)