摘要
大型语言模型的进展推动了能进行复杂推理和多步问题求解的自主代理发展。然而,这些代理难以适应专用环境,且无法利用过往交互经验,每次面对新任务均从零开始。本文提出经验反思学习(ERL),一种简单的自我改进框架,通过经验学习实现快速环境适应。ERL 通过反思任务轨迹和结果生成启发式规则,捕捉可跨任务迁移的行动教训。测试时,系统根据当前任务检索相关启发式规则并注入代理上下文以指导执行。在 Gaia2 基准上,ERL 较 ReAct 基线成功率提升 7.8%,显著提高了任务完成可靠性,并优于现有经验学习方法。
AI 推荐理由
论文提出自我改进框架,通过反思经验提取启发式规则实现代理进化,核心聚焦自我进化。
研究机构
Illuin Technology
论文信息