Reinforcement Learning Self-Evolution Experience Replay Multi-Turn Agents
摘要

大型语言模型智能体在多轮工具使用任务中表现优异,但训练时往往孤立运行,未能利用跨回合积累的经验。现有方法虽构建可检索经验库,却仅基于初始任务静态检索,无法适应多轮环境中观测值的动态变化。本文提出 SLEA-RL 框架,在每一步决策时根据当前观测动态检索相关经验。该框架包含三步级观测聚类、自进化经验库及步级信用分配策略优化。经验库通过语义分析而非梯度更新随策略共同进化,实验表明其在长程多轮基准上显著优于现有强化学习基线。

AI 推荐理由

提出自进化经验库,通过语义分析持续蒸馏策略与失败模式,核心聚焦自我改进。

研究机构
卡内基梅隆大学
论文信息
作者 Prince Zizhuang Wang, Shuli Jiang
发布日期 2026-03-18
arXiv ID 2603.18079
相关性评分 9/10 (高度相关)