自我进化 反思学习 代理恢复 监督微调
摘要

大型语言模型作为自主代理需在长程交互中规划、行动并从错误中恢复。然而,现有的结果驱动后训练方法主要优化最终成功信号,导致策略分布锐化,缺乏基于反馈的代理能力。为此,本文提出 LEAFE 框架,通过反思经验内化恢复能力。该框架在探索中将环境反馈总结为可操作经验,回溯至早期决策点并尝试修正动作,随后通过监督微调将这些经验指导的纠正 distilled 到模型中。实验表明,LEAFE 在多种交互编码和代理任务中显著提升了 Pass@1 和 Pass@k 指标。

AI 推荐理由

论文提出通过反思经验内化恢复能力,核心在于代理的自我改进与自适应机制。

研究机构
清华大学 中国科学院自动化研究所
论文信息
作者 Rui Ge, Yichao Fu, Yuyang Qian, Junda Su, Yiming Zhao et al.
发布日期 2026-03-17
arXiv ID 2603.16843
相关性评分 9/10 (高度相关)