World Models Self-Improvement Cycle Consistency Reinforcement Learning
摘要

通用世界模型虽有望扩展策略评估与规划,但在次优动作下的鲁棒性仍具挑战。为此,本文提出世界动作验证器(WAV),一种能使世界模型识别自身预测误差并自我改进的框架。其核心思想是将动作条件的状态预测分解为状态合理性与动作可达性两个因子分别验证。利用数据可用性与特征维度的不对称性,WAV 结合视频语料生成的子目标与稀疏逆向模型,通过强制循环一致性,在探索不足的区域提供有效验证。实验表明,该方法在九个任务中样本效率提升两倍,下游策略性能提高 18%。

AI 推荐理由

论文提出框架使世界模型能识别自身预测误差并自我改进,核心聚焦于模型的自我进化机制。

研究机构
Stanford University UC San Diego Carnegie Mellon University Google DeepMind Harvard University
论文信息
作者 Yuejiang Liu, Fan Feng, Lingjing Kong, Weifeng Lu, Jinzhou Tang et al.
发布日期 2026-04-02
arXiv ID 2604.01985
相关性评分 9/10 (高度相关)