摘要
针对端到端视觉 - 语言 - 动作模型在微调中损害推理能力的问题,本文提出 HiVLA,一种以视觉接地为核心的分层框架,显式解耦高层语义规划与底层运动控制。高层部分利用视觉语言模型进行任务分解和视觉接地,生成包含子任务指令及精确目标边界框的结构化计划;底层部分引入带有级联交叉注意力机制的流匹配扩散 Transformer 动作专家,融合全局上下文与技能语义以执行鲁棒操作。该架构既保留了零样本推理能力,又实现了长程技能组合与精细操纵的显著提升。
AI 推荐理由
论文核心提出分层架构,显式解耦高层语义规划与底层控制,重点在于任务分解与结构化计划生成。
研究机构
The University of Hong Kong
Shanghai AI Laboratory
Shanghai Jiao Tong University
论文信息