摘要
学习具备领域泛化能力的策略是规划学习中的关键挑战。传统方法利用教师规划器生成的最优计划,通过监督学习训练基于图神经网络的状态价值函数。本文主张转而学习 Q 值函数,因其仅需处理当前状态而非所有后继状态,评估成本显著降低。针对直接监督学习 Q 值效果不佳的问题,我们引入正则化项以区分教师采取与未采取的动作。实验表明,该方法在十个领域中均优于状态价值策略,并与 LAMA-first 规划器具有竞争力。
AI 推荐理由
论文核心研究规划中的策略学习,提出 Q 值函数方法以提升规划效率与鲁棒性。
研究机构
德国人工智能研究中心(DFKI),萨尔布吕肯,德国
萨尔大学,萨尔布吕肯,德国
论文信息