摘要
大型语言模型作为自主代理需在长程交互中规划、行动并从错误中恢复。然而,现有的结果驱动后训练方法主要优化最终成功信号,导致策略分布锐化,缺乏基于反馈的代理能力。为此,本文提出 LEAFE 框架,通过反思经验内化恢复能力。该框架在探索中将环境反馈总结为可操作经验,回溯至早期决策点并尝试修正动作,随后通过监督微调将这些经验指导的纠正 distilled 到模型中。实验表明,LEAFE 在多种交互编码和代理任务中显著提升了 Pass@1 和 Pass@k 指标。
AI 推荐理由
论文提出通过反思经验内化恢复能力,核心在于代理的自我改进与自适应机制。
研究机构
清华大学
中国科学院自动化研究所
论文信息