AI 自动化 自我进化 后训练 基准测试 安全风险
摘要

本文探讨 LLM Agent 能否自动化 AI 研究中的关键阶段——后训练。我们提出 PostTrainBench 基准,评估 Agent 在有限算力下自主优化基础模型性能的能力。实验发现,前沿 Agent 虽取得显著进展,但整体仍落后于官方指令微调模型;不过在特定场景下可超越官方模型。研究还揭示了奖励黑客等失败模式,强调了沙箱机制的重要性,旨在追踪 AI 研发自动化进程及相关风险。

AI 推荐理由

论文核心研究 Agent 自主进行模型后训练以实现自我改进与进化,属于典型的自我进化范畴。

研究机构
清华大学 微软研究院
论文信息
作者 Ben Rank, Hardik Bhatnagar, Ameya Prabhu, Shira Eisenberg, Karina Nguyen et al.
发布日期 2026-03-09
arXiv ID 2603.08640
相关性评分 9/10 (高度相关)