摘要
本文提出一种富含运动学信息的视觉 - 语言 - 动作(VLA)新任务,要求语言指令精细编码方向、轨迹等属性。针对任务目标不变但执行轨迹需适应指令变化的挑战,提出了 KineVLA 框架。该框架通过双层动作表示和推理令牌,显式解耦目标层不变性与运动学层可变性,作为对齐语言与动作的监督中间变量。构建了涵盖仿真与实机的数据集,实验表明该方法在运动学敏感基准上优于现有基线,实现了更精准、可控的操作行为。
AI 推荐理由
提出双层动作分解与推理机制,核心解决任务目标不变下的轨迹规划适应性问题。
论文信息