Reinforcement Learning Co-evolution Agent Efficiency Experience Replay
摘要

强化学习是训练大语言模型代理的有力范式,但受限于样本效率低,主要源于稀疏反馈及无法跨回合利用先验经验。现有方法中,从历史提炼的经验要么静态存储,要么无法随演员能力提升而协同进化,导致效用递减。受神经科学互补学习系统启发,本文提出互补强化学习,实现经验提取器与策略演员在优化循环中的无缝协同进化。演员基于稀疏结果奖励优化,而提取器则根据其提炼经验对成功的贡献度进行优化。实验表明,该方法在单任务场景中性能提升 10%,并在多任务设置中展现出强大的可扩展性。

AI 推荐理由

论文核心提出经验提取器与策略演员的协同进化机制,解决能力错位问题。

研究机构
新疆大学 HUST
论文信息
作者 Dilxat Muhtar, Jiashun Liu, Wei Gao, Weixun Wang, Shaopan Xiong et al.
发布日期 2026-03-18
arXiv ID 2603.17621
相关性评分 9/10 (高度相关)