摘要
针对大语言模型(LLM)静态知识与强化学习动态环境不匹配的问题,本文提出 PriorZero 框架。该方法将 LLM 概念先验融入基于世界模型的规划中,采用解耦的 rollout-训练设计。在 rollout 阶段,通过根节点先验注入机制,仅在蒙特卡洛树搜索根节点引入 LLM 先验,聚焦语义可行动作;在训练阶段,解耦世界模型学习与 LLM 适配,利用世界模型提供细粒度信用分配信号以稳定微调。实验表明,该方法显著提升了探索效率与渐近性能。
AI 推荐理由
论文提出基于世界模型的规划框架,核心利用 MCTS 进行长程任务决策与搜索。
研究机构
University of Science and Technology of China
Shanghai Artificial Intelligence Laboratory
Nanjing University of Aeronautics and Astronautics
The Chinese University of Hong Kong MMLab
论文信息