摘要
标准视觉 - 语言 - 动作(VLA)模型依赖统计先验,缺乏对物理动态的鲁棒理解。现有强化学习依赖外部奖励,世界动作模型缺乏显式自改进机制。为此,本文提出自校正 VLA(SC-VLA),通过稀疏想象内在引导动作优化以实现自我改进。该方法设计稀疏世界想象模块预测任务进度与轨迹趋势,约束策略编码短期物理演化;并引入在线动作优化模块,基于预测状态重塑奖励以调整轨迹方向。实验表明,SC-VLA 在仿真与真实机器人操作中均达到最先进水平,显著减少步数并提升成功率。
AI 推荐理由
论文提出 SC-VLA,核心机制是通过稀疏想象引导在线动作修正,实现智能体的自我改进与自适应。
研究机构
Tongji University
University of Electronic Science and Technology of China
论文信息