摘要
扩散规划器是离线强化学习的有效方法,但在值引导选择偏好高分却局部不符合环境动态的轨迹时,会导致执行脆弱。本文提出基于能量的自监督动作门控(SAGE),一种推理时重排序方法,利用潜在一致性信号惩罚动态不一致的计划。SAGE 训练联合嵌入预测架构编码器及动作条件的潜在预测器,在测试时根据潜在预测误差分配能量,结合可行性评分与值估计选择动作。该方法无需环境 rollout 或策略重训练,显著提升了扩散规划器在多种基准任务中的性能与鲁棒性。
AI 推荐理由
论文提出 SAGE 方法,直接针对扩散规划器在推理时的轨迹选择与一致性问题进行优化,属于规划核心研究。
研究机构
University College London, London, UK
Microsoft Research, Correspondence to: Yuan
Microsoft Research
论文信息