摘要
生成优化利用大语言模型通过执行反馈迭代改进工件,是构建自改进 Agent 的关键途径,但在实践中表现脆弱。本文指出这种脆弱性源于工程师在建立学习循环时需做出隐含的设计选择,包括初始工件、执行轨迹的信用范围以及错误批处理策略。通过在多个基准测试中的案例研究,发现这些设计决策直接决定优化成败,却常被既往研究忽视。文章结论认为缺乏通用的学习循环设置方法是主要障碍,并提供了实践指导。
AI 推荐理由
论文核心研究基于反馈的迭代生成优化,即 Agent 的自我改进与进化机制。
研究机构
Work done before joining Google DeepMind
Stanford University
Microsoft
Google
论文信息