摘要
无监督预训练推动了目标条件强化学习(GCRL)的发展,但其理论基础尚不明确。本文针对互信息技能学习(MISL)为何能支持目标达成这一理论谜题,提出将 GCRL 与 MISL 统一为控制最大化的实例。研究证明了三种主流 GCRL 公式的根本不等价性,并揭示了高性能策略对未来轨迹的目标敏感性本质。通过分析 MISL 目标作为技能敏感度的度量,建立了其与下游任务的具体对应关系,为强化学习预训练奠定了理论基础,并指导了特定任务下的预训练目标选择。
AI 推荐理由
论文核心研究无监督技能学习(MISL)及其与目标条件 RL 的理论统一,直接涉及技能发现机制。
研究机构
HeinrichsMunich, Germany
Max Planck Institute for Biological Cybernetics, Germany
Princeton University, USA
University of Tübingen, Germany
论文信息