摘要
通用机器人需掌握非结构化环境中的长程操作任务。针对视觉 - 语言 - 动作模型在技能排序及级联失败方面的局限,本文提出 LiLo-VLA 框架。该方法将移动与交互解耦:到达模块处理全局运动,交互模块利用物体中心 VLA 处理目标物体,从而提升鲁棒性。其模块化设计支持动态重规划与技能复用,有效缓解级联错误。仿真与真实世界实验表明,该方法在长程任务中显著优于现有基线,实现了卓越的零样本泛化能力。
AI 推荐理由
论文核心解决长程任务中的序列组合与动态重规划问题,通过模块化架构实现鲁棒的任务规划。
研究机构
北卡罗来纳大学教堂山分校
佐治亚理工学院
卡内基梅隆大学
论文信息