摘要
针对大语言模型智能体在现实任务中高失败率导致大量经验数据被丢弃的问题,本文提出 AgentHER 框架。该框架适配后见经验回放(HER)原理,将失败轨迹转化为可替代目标的正确示范,通过四阶段流程生成高质量训练数据。实验表明,该方法在 WebArena 和 ToolBench 基准上显著优于仅使用成功数据的监督微调,提升了数据效率,并支持模型的迭代部署与持续自我进化。
AI 推荐理由
论文提出利用失败轨迹进行数据增强,通过自我反思和重标注实现模型持续改进与性能提升。
研究机构
阿里巴巴集团
论文信息