摘要
强化学习是训练大语言模型代理的有力范式,但受限于样本效率低,主要源于稀疏反馈及无法跨回合利用先验经验。现有方法中,从历史提炼的经验要么静态存储,要么无法随演员能力提升而协同进化,导致效用递减。受神经科学互补学习系统启发,本文提出互补强化学习,实现经验提取器与策略演员在优化循环中的无缝协同进化。演员基于稀疏结果奖励优化,而提取器则根据其提炼经验对成功的贡献度进行优化。实验表明,该方法在单任务场景中性能提升 10%,并在多任务设置中展现出强大的可扩展性。
AI 推荐理由
论文核心提出经验提取器与策略演员的协同进化机制,解决能力错位问题。
研究机构
新疆大学
HUST
论文信息