摘要
学习到的世界模型为评估未来状态提供了强大的物理直觉,但其在连续控制中的有效性关键取决于如何生成候选动作以进行基于模型的规划。本文提出 PRISM,一种任务无关的框架,直接从单一数据集中提取动作先验,无需额外架构。该方法在冻结的世界模型编码器上附加轻量级 MLP,预测状态条件化的高斯先验,并在规划时通过精度加权的乘积更新将其融合到采样分布中。实验表明,PRISM 在 Cube 和 PushT 任务上的成功率分别提升了 35% 和 32%,且未显著增加推理开销。
AI 推荐理由
论文核心提出基于世界模型的规划框架,通过先验引导采样优化动作生成,显著提升规划效率。
研究机构
Northeastern University
University of California, Berkeley
Qiyuan Lab
University of Florida
论文信息