Self-Evolving Agents Tool Memory RLVR Resource-Constrained
摘要

近期基于可验证奖励的强化学习在单步推理任务中表现优异,但面向自我进化的代理学习仍需从轨迹中合成工具或积累显式经验。现有方法多依赖大模型或多代理框架,难以在资源受限环境部署,且结果稀疏奖励导致学习困难。为此,本文提出基于工具记忆的自进化代理框架 SEARL。该方法构建结构化经验记忆,整合规划与执行,提供新型状态抽象以促进跨情境泛化。代理从中提取显式知识并利用轨迹间相关性稠密化奖励信号,在知识推理与数学任务中验证了其高效性。

AI 推荐理由

论文提出 SEARL 框架,核心目标是实现代理的自我进化,通过工具记忆优化策略。

研究机构
Shanghai Artificial Intelligence Laboratory Shanghai Jiaotong University
论文信息
作者 Xinshun Feng, Xinhao Song, Lijun Li, Gongshen Liu, Jing Shao
发布日期 2026-04-09
arXiv ID 2604.07791
相关性评分 9/10 (高度相关)