World Modeling VLA Autonomous Planning Causal Forecasting
摘要

物理世界知识主要蕴含于视频中,赋予视觉 - 语言 - 动作(VLA)模型此类知识对安全且可泛化的规划至关重要。针对视频令牌冗余及长程因果建模困难的问题,本文提出 X-Foresight,一种集成于 VLA 架构的预测世界模型。其核心采用长程分块自回归策略,通过预测语义远距离分块避免平凡外推,同时保留密集帧内动态与稀疏帧间过渡以捕捉长程因果。结合课程学习与时间重要性采样,该方法显著提升了 VLA 在规划任务中的表现,确立了知识驱动的自主系统新范式。

AI 推荐理由

论文核心是通过预测世界模型提升 VLA 的长程因果推理与安全规划能力,直接解决规划难题。

研究机构
XPeng Inc.
论文信息
作者 Baolu Li, Jingyu Qian, Rui Guo, Yilun Chen, Hanpeng Liu et al.
发布日期 2026-05-24
arXiv ID 2605.24892
相关性评分 9/10 (高度相关)