Offline RL Model Predictive Control Decision Transformer Planning
摘要

基于决策变压器的序列策略在离线强化学习中表现强劲,但受限于静态数据集质量及架构缺陷,难以有效整合次优经验并进行显式最优规划。为此,本文提出虚拟规划蒸馏(IPD)框架,将离线规划无缝融入数据生成、监督训练及在线推理全过程。该方法首先学习具备不确定性度量与准最优价值函数的世界模型,利用模型预测控制生成可靠的虚拟最优轨迹以增强数据。随后,结合价值引导目标训练 Transformer 策略,并以学到的价值函数替代传统人工设定的回报阈值,显著提升了决策稳定性与性能。

AI 推荐理由

论文提出虚拟规划蒸馏框架,核心利用 MPC 进行显式规划以增强策略,紧密契合规划主题。

研究机构
香港科技大学(广州)科学与技术学院 香港科技大学(广州) 北京大学 北京
论文信息
作者 Yihao Qin, Yuanfei Wang, Hang Zhou, Peiran Liu, Hao Dong et al.
发布日期 2026-03-04
arXiv ID 2603.04289
相关性评分 9/10 (高度相关)