摘要
经验回放对强化学习的数据效率至关重要,但传统方法将其视为被动记忆系统,仅基于数值预测误差优先采样,忽视了语义重要性。这与人类通过主动抽象碎片化经验为行为规则以加速掌握的学习方式形成对比。为此,本文提出神经符号经验回放(NSER)框架,通过新颖的神经符号 grounding 流程,利用大语言模型零样本诱导候选行为规则,将其落地为可微分的一阶逻辑表示,并动态重加权回放分布。该方法使抽象知识直接塑造策略优化,在多种基准测试中显著提升了样本效率和收敛速度。
AI 推荐理由
论文核心提出神经符号经验回放框架,主动重构记忆机制,将被动样本复用转化为主动知识构建。
研究机构
Equal contribution
Affiliation 1
Affiliation 2
Affiliation 3
论文信息