摘要
视觉 - 语言 - 动作(VLA)模型日益依赖辅助世界模块进行长视野规划,但其参数化设计尚不明确。现有方法通常以高视觉带宽传递每帧图像,导致表示与动作耦合未被充分探索。本文提出 OneWM-VLA,通过自适应注意力池化将每帧压缩为单个语义令牌,并在单一流动匹配目标下联合生成潜在流与动作轨迹。实验表明,单令牌带宽未损害长程性能,且在多个基准测试中显著提升了任务成功率。
AI 推荐理由
论文核心研究利用世界模型进行长视野任务规划,显著提升长程任务成功率。
研究机构
浙江大学
中南大学
哈尔滨工业大学
中国科学院
论文信息