Long-Horizon Tasks Autonomous Agents Iterative Optimization Benchmark
摘要

科学与工程进步本质上是长周期的迭代过程。现有基准多评估单轮响应或短周期轨迹,难以捕捉持续迭代改进的挑战。为此,本文提出 AutoLab,一个用于超长周期闭环优化的新基准,涵盖系统优化、谜题挑战、模型开发及 CUDA 内核优化四大领域的 36 项专家策划任务。实验评估了 17 个前沿模型,发现成功的关键并非初始尝试的质量,而是代理在严格时间预算内反复基准测试、编辑代码并整合实证反馈的持久性。结果显示,除少数模型外,大多数前沿模型要么过早终止,要么耗尽预算却进展甚微,突显了时间感知与持久迭代在自主代理中的重要性。

AI 推荐理由

论文核心研究 Agent 在长周期任务中的自我迭代、反馈修正与持续优化能力,属于自我进化范畴。

研究机构
University of Washington Stanford University UCSB University of Notre Dame Princeton University NUS University of Waterloo MIT NVIDIA Bake AI MIT-IBM Computing Research Lab Independent Researcher Google
论文信息
作者 Zhangchen Xu, Junda Chen, Yue Huang, Dongfu Jiang, Jiefeng Chen et al.
发布日期 2026-06-03
arXiv ID 2606.05080
相关性评分 9/10 (高度相关)