摘要
本文针对具有自然多层结构的序列决策问题,提出一种高效的多层过程,通过压缩马尔可夫决策过程(MDP),将低层策略视为高层动作,同时保留原始语义结构。该方法解耦子任务,减少随机性与策略搜索空间,提升长时期最优策略求解效率。此外,通过将策略分解为嵌入与技能,实现了跨问题及跨层级的技能迁移,并在课程学习框架下逐步增加任务难度,促进知识迁移。实验在 MazeBase+等场景中验证了抽象性、可迁移性及课程学习的有效性。
AI 推荐理由
论文核心提出基于技能的课程学习,通过技能分解与迁移解决多层决策问题。
研究机构
约翰霍普金斯大学应用数学与统计系
论文信息