Vision-Language-Action Chain-of-Thought Parallel Reasoning Robotics
摘要

视觉 - 语言 - 动作(VLA)模型在处理需逻辑规划及精细空间感知的复杂多步任务时存在局限。现有基于思维链(CoT)的方法受限于单模态推理无法兼顾高低层信息,且自回归解码导致高延迟与误差累积。本文提出 DualCoT-VLA,集成用于低层空间理解的视觉 CoT 与用于高层任务规划的语言 CoT,并引入含可学习查询令牌的双路并行推理机制,将自回归推理转化为单步前向推理。实验表明,该方法在 LIBERO、RoboCasa GR1 基准及真实机器人平台上均达到最先进水平。

AI 推荐理由

提出双模态思维链与并行推理机制,核心解决复杂任务中的逻辑规划与空间感知推理难题。

研究机构
香港科技大学
论文信息
作者 Zhide Zhong, Junfeng Li, Junjie He, Haodong Yan, Xin Gong et al.
发布日期 2026-03-23
arXiv ID 2603.22280
相关性评分 9/10 (高度相关)