摘要
本文提出 DynVLA,一种引入“动态思维链”(Dynamics CoT)新范式的驾驶视觉 - 语言 - 动作模型。该模型在生成动作前预测紧凑的世界动态,以实现更具信息量且符合物理规律的决策。通过动态分词器将未来演化压缩为少量标记,并解耦自我中心与环境中心动态,提升了建模准确性。经监督微调与强化反馈训练,DynVLA 在多个数据集上优于文本及视觉思维链方法,验证了其高效性与实用价值。
AI 推荐理由
提出 Dynamics CoT 新范式,通过预测世界动态增强动作推理,核心解决推理问题。
研究机构
清华大学
论文信息