摘要
预测 AI 系统何时能加速自身研究是安全领域的关键挑战。现有基准缺乏对递归自我改进的早期预警。本文提出新基准,要求前沿代码智能体仅凭极简任务描述,自主复现过往突破性机器学习流水线。实验显示,智能体能在消费级硬件上三小时内构建四子棋 AlphaZero 系统。Claude Opus 4.7 表现显著优于其他模型,接近饱和。该研究揭示了智能体在自主科研能力上的分化及潜在的“沙袋”行为,为评估 AI 自我进化提供了实证依据。
AI 推荐理由
论文核心评估 Agent 自主复现经典 AI 算法(AlphaZero)的能力,直接对应自我进化与递归改进。
研究机构
芝加哥大学计算机科学系
论文信息