摘要
近期基于可验证奖励的强化学习在单步推理任务中表现优异,但面向自我进化的代理学习仍需从轨迹中合成工具或积累显式经验。现有方法多依赖大模型或多代理框架,难以在资源受限环境部署,且结果稀疏奖励导致学习困难。为此,本文提出基于工具记忆的自进化代理框架 SEARL。该方法构建结构化经验记忆,整合规划与执行,提供新型状态抽象以促进跨情境泛化。代理从中提取显式知识并利用轨迹间相关性稠密化奖励信号,在知识推理与数学任务中验证了其高效性。
AI 推荐理由
论文提出 SEARL 框架,核心目标是实现代理的自我进化,通过工具记忆优化策略。
研究机构
Shanghai Artificial Intelligence Laboratory
Shanghai Jiaotong University
论文信息