摘要
科学与工程进步本质上是长周期的迭代过程。现有基准多评估单轮响应或短周期轨迹,难以捕捉持续迭代改进的挑战。为此,本文提出 AutoLab,一个用于超长周期闭环优化的新基准,涵盖系统优化、谜题挑战、模型开发及 CUDA 内核优化四大领域的 36 项专家策划任务。实验评估了 17 个前沿模型,发现成功的关键并非初始尝试的质量,而是代理在严格时间预算内反复基准测试、编辑代码并整合实证反馈的持久性。结果显示,除少数模型外,大多数前沿模型要么过早终止,要么耗尽预算却进展甚微,突显了时间感知与持久迭代在自主代理中的重要性。
AI 推荐理由
论文核心研究 Agent 在长周期任务中的自我迭代、反馈修正与持续优化能力,属于自我进化范畴。
研究机构
University of Washington
Stanford University
UCSB
University of Notre Dame
Princeton University
NUS
University of Waterloo
MIT
NVIDIA
Bake AI
MIT-IBM Computing Research Lab
Independent Researcher
Google
论文信息