Embodied AI Hierarchical Planning Visual Grounding Robotics
摘要

针对端到端视觉 - 语言 - 动作模型在微调中损害推理能力的问题,本文提出 HiVLA,一种以视觉接地为核心的分层框架,显式解耦高层语义规划与底层运动控制。高层部分利用视觉语言模型进行任务分解和视觉接地,生成包含子任务指令及精确目标边界框的结构化计划;底层部分引入带有级联交叉注意力机制的流匹配扩散 Transformer 动作专家,融合全局上下文与技能语义以执行鲁棒操作。该架构既保留了零样本推理能力,又实现了长程技能组合与精细操纵的显著提升。

AI 推荐理由

论文核心提出分层架构,显式解耦高层语义规划与底层控制,重点在于任务分解与结构化计划生成。

研究机构
The University of Hong Kong Shanghai AI Laboratory Shanghai Jiao Tong University
论文信息
作者 Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu et al.
发布日期 2026-04-15
arXiv ID 2604.14125
相关性评分 9/10 (高度相关)