RL Post-Training Agent Self-Improvement Benchmark Automated ML
摘要

本文提出 Agent^2 RL-Bench,旨在评估 LLM 智能体能否自主设计、实现并运行完整的强化学习(RL)流程以改进基础模型。针对现有基准缺乏对交互式 RL 工程测试的问题,该基准涵盖从静态规则训练到闭环在线 RL 的六个任务层级。实验表明,智能体在特定任务(如 ALFWorld)上通过在线滚动能取得显著提升,但在其他任务上进展有限,且驱动模型的选择对结果影响巨大。研究揭示了在固定预算下监督流程的主导地位及在线 RL 的适用边界。

AI 推荐理由

论文核心研究 Agent 自主设计并执行 RL 流程以改进基础模型,属于典型的自我进化与自适应能力。

研究机构
Soochow University Microsoft Research Asia Peking University Stony Brook University The University of Chicago
论文信息
作者 Wanyi Chen, Xiao Yang, Xu Yang, Tianming Sha, Qizheng Li et al.
发布日期 2026-04-12
arXiv ID 2604.10547
相关性评分 9/10 (高度相关)