Embodied AI Chain-of-Thought Human-Robot Interaction VLA Models
摘要

本文提出 GTA-VLA 框架,通过允许用户利用显式视觉线索引导机器人策略,实现可空间操控的具身推理。现有模型多为直接映射,缺乏应对分布外shift 及纠错能力;虽有思维链方法,但缺失人类空间指导机制。本框架引入空间先验(如 affordance 点、框),生成统一的空间视觉思维链,融合外部指导与内部规划。实验表明,该方法在域内基准达最先进水平,且在视觉偏移和空间模糊下,单次交互即可显著提升任务成功率,有效支持故障恢复。

AI 推荐理由

提出交互式具身推理框架,核心创新为空间视觉思维链,显著提升推理鲁棒性。

研究机构
Putian Laboratory Faculty of Computing, Harbin Institute of Technology International Digital Economy Academy (IDEA) School of Robotics, Hunan University South China University of Technology National Key Laboratory of Smart Farm Technologies and Systems
论文信息
作者 Yiran Ling, Qing Lian, Jinghang Li, Qing Jiang, Tianming Zhang et al.
发布日期 2026-05-13
arXiv ID 2605.13632
相关性评分 9/10 (高度相关)