摘要
现有深度研究智能体基准仅评估单次输出,忽视了反馈引导下的改进能力。本文通过多轮评估,对比了无外部信号的自我反思与针对研究策略差距的过程级反馈两种设置。为此,我们设计了研究差距推断方法以生成过程级反馈。研究发现:自我反思几乎无净增益;单轮过程级反馈可显著提升性能;但增益无法在多轮中累积,智能体重写报告时会出现回退。结果表明,当前架构尚难实现可靠的多轮自我进化。
AI 推荐理由
论文核心研究 Agent 在反馈下的自我改进与反思能力,直接对应自我进化主题。
研究机构
School of Informatics, University of Edinburgh, United Kingdom
论文信息