Reinforcement Learning Skill Discovery Theoretical Analysis Unsupervised Learning
摘要

无监督预训练推动了目标条件强化学习(GCRL)的发展,但其理论基础尚不明确。本文针对互信息技能学习(MISL)为何能支持目标达成这一理论谜题,提出将 GCRL 与 MISL 统一为控制最大化的实例。研究证明了三种主流 GCRL 公式的根本不等价性,并揭示了高性能策略对未来轨迹的目标敏感性本质。通过分析 MISL 目标作为技能敏感度的度量,建立了其与下游任务的具体对应关系,为强化学习预训练奠定了理论基础,并指导了特定任务下的预训练目标选择。

AI 推荐理由

论文核心研究无监督技能学习(MISL)及其与目标条件 RL 的理论统一,直接涉及技能发现机制。

研究机构
HeinrichsMunich, Germany Max Planck Institute for Biological Cybernetics, Germany Princeton University, USA University of Tübingen, Germany
论文信息
作者 Alireza Modirshanechi, Benjamin Eysenbach, Peter Dayan, Eric Schulz
发布日期 2026-05-07
arXiv ID 2605.06145
相关性评分 9/10 (高度相关)