摘要
视觉 - 语言 - 动作(VLA)模型在处理需逻辑规划及精细空间感知的复杂多步任务时存在局限。现有基于思维链(CoT)的方法受限于单模态推理无法兼顾高低层信息,且自回归解码导致高延迟与误差累积。本文提出 DualCoT-VLA,集成用于低层空间理解的视觉 CoT 与用于高层任务规划的语言 CoT,并引入含可学习查询令牌的双路并行推理机制,将自回归推理转化为单步前向推理。实验表明,该方法在 LIBERO、RoboCasa GR1 基准及真实机器人平台上均达到最先进水平。
AI 推荐理由
提出双模态思维链与并行推理机制,核心解决复杂任务中的逻辑规划与空间感知推理难题。
研究机构
香港科技大学
论文信息