摘要
本文探讨 LLM Agent 能否自动化 AI 研究中的关键阶段——后训练。我们提出 PostTrainBench 基准,评估 Agent 在有限算力下自主优化基础模型性能的能力。实验发现,前沿 Agent 虽取得显著进展,但整体仍落后于官方指令微调模型;不过在特定场景下可超越官方模型。研究还揭示了奖励黑客等失败模式,强调了沙箱机制的重要性,旨在追踪 AI 研发自动化进程及相关风险。
AI 推荐理由
论文核心研究 Agent 自主进行模型后训练以实现自我改进与进化,属于典型的自我进化范畴。
研究机构
清华大学
微软研究院
论文信息