摘要
分层视觉 - 语言 - 动作(Hi-VLA)系统通过高层规划器将任务分解为语言子目标,已成为复杂机器人操作的前沿范式。然而,现有系统在设计原则上缺乏统一性。本文在选项式控制框架下统一了代表性 Hi-VLA 代理,并在短程、长程及强推理任务中基准测试了核心设计选择。研究提炼出构建 Hi-VLA 系统的实用原则,揭示了模型选择与接口机制如何共同塑造性能。应用这些原则构建的系统在仿真及真实 ALOHA 机器人实验中,表现显著优于扁平化控制或朴素分层设计。
AI 推荐理由
论文核心研究分层 VLA 架构中的高层任务分解与子目标规划机制。
研究机构
Google DeepMind
论文信息