Self-Improvement Robotics World Models Online Refinement
摘要

标准视觉 - 语言 - 动作(VLA)模型依赖统计先验,缺乏对物理动态的鲁棒理解。现有强化学习依赖外部奖励,世界动作模型缺乏显式自改进机制。为此,本文提出自校正 VLA(SC-VLA),通过稀疏想象内在引导动作优化以实现自我改进。该方法设计稀疏世界想象模块预测任务进度与轨迹趋势,约束策略编码短期物理演化;并引入在线动作优化模块,基于预测状态重塑奖励以调整轨迹方向。实验表明,SC-VLA 在仿真与真实机器人操作中均达到最先进水平,显著减少步数并提升成功率。

AI 推荐理由

论文提出 SC-VLA,核心机制是通过稀疏想象引导在线动作修正,实现智能体的自我改进与自适应。

研究机构
Tongji University University of Electronic Science and Technology of China
论文信息
作者 Chenyv Liu, Wentao Tan, Lei Zhu, Fengling Li, Jingjing Li et al.
发布日期 2026-02-25
arXiv ID 2602.21633
相关性评分 9/10 (高度相关)