摘要
标准具身评估未独立评分智能体在 episode 结束时是否正确承诺任务完成(即终端承诺)。行为各异的失败类型被混淆为同一基准失败。本文提出 VIGIL 评估框架,使终端承诺可独立度量。在该协议下,智能体仅观察第一人称 RGB 图像,无动作成功信号,须以语义报告结束 episode,并针对隐藏世界状态进行确定性校验。此举分离出世界状态完成度与基准成功率两个指标,区分四类结果。实验表明,执行能力相近的模型在终端报告生成上差异显著,揭示了规划中终止决策的独立性。
AI 推荐理由
论文核心研究智能体任务完成判定与终止决策,属于目标导向行为规划的关键环节。
研究机构
XPENG Robotics
The Hong Kong Polytechnic University
论文信息