摘要
针对大语言模型代理在企业部署中面临的数据受限、执行不安全及无法从失败中学习等挑战,本文提出 AOI(自主运营智能)框架。该框架将自动化运营建模为安全约束下的轨迹学习问题,包含三大组件:基于 GRPO 的可训练诊断系统以蒸馏专家知识;读写分离的执行架构以确保安全学习;以及失败轨迹闭环演化器,能将 unsuccessful 轨迹转化为纠正性监督信号以实现持续数据增强。实验表明,AOI 显著提升了任务成功率,并有效利用失败案例优化模型性能。
AI 推荐理由
论文核心提出利用失败轨迹生成训练信号,实现 Agent 的自我进化与持续改进。
研究机构
Gradient, Soochow University
UC Santa Cruz
Georgia Institute of Technology
University College London
Cookiy.ai
论文信息