Self-Evolution Failure Learning SRE Automation Multi-Agent System
摘要

针对大语言模型代理在企业部署中面临的数据受限、执行不安全及无法从失败中学习等挑战,本文提出 AOI(自主运营智能)框架。该框架将自动化运营建模为安全约束下的轨迹学习问题,包含三大组件:基于 GRPO 的可训练诊断系统以蒸馏专家知识;读写分离的执行架构以确保安全学习;以及失败轨迹闭环演化器,能将 unsuccessful 轨迹转化为纠正性监督信号以实现持续数据增强。实验表明,AOI 显著提升了任务成功率,并有效利用失败案例优化模型性能。

AI 推荐理由

论文核心提出利用失败轨迹生成训练信号,实现 Agent 的自我进化与持续改进。

研究机构
Gradient, Soochow University UC Santa Cruz Georgia Institute of Technology University College London Cookiy.ai
论文信息
作者 Pei Yang, Wanyi Chen, Yuxi Zheng, Xueqian Li, Xiang Li et al.
发布日期 2026-03-03
arXiv ID 2603.03378
相关性评分 9/10 (高度相关)