World Models VLA Long-horizon Planning Visual Compression
摘要

视觉 - 语言 - 动作(VLA)模型日益依赖辅助世界模块进行长视野规划,但其参数化设计尚不明确。现有方法通常以高视觉带宽传递每帧图像,导致表示与动作耦合未被充分探索。本文提出 OneWM-VLA,通过自适应注意力池化将每帧压缩为单个语义令牌,并在单一流动匹配目标下联合生成潜在流与动作轨迹。实验表明,单令牌带宽未损害长程性能,且在多个基准测试中显著提升了任务成功率。

AI 推荐理由

论文核心研究利用世界模型进行长视野任务规划,显著提升长程任务成功率。

研究机构
浙江大学 中南大学 哈尔滨工业大学 中国科学院
论文信息
作者 Zuojin Tang, Shengchao Yuan, Xiaoxin Bai, Zhiyuan Jin, De Ma et al.
发布日期 2026-05-08
arXiv ID 2605.07931
相关性评分 9/10 (高度相关)