摘要
深度强化学习智能体常因过度利用早期奖励信号而产生错位。针对此问题,本文提出一种受人类技能习得启发的混合方法:混合分层强化学习(H^2RL)。该框架通过两阶段策略,将符号结构注入基于神经网络的智能体中,既保留了深度策略的表达力,又利用基于逻辑选项的预训练引导策略摆脱短期奖励循环,转向目标导向行为。实验表明,该方法显著提升了长程决策能力,性能优于现有的神经、符号及神经符号基线模型。
AI 推荐理由
论文提出混合分层 RL 框架,利用逻辑选项预训练引导智能体进行目标导向行为和长程决策规划。
研究机构
德国达姆施塔特工业大学计算机科学系
德国达姆施塔特工业大学AIML集团/IAS集团/DFKI·黑森AI
论文信息