摘要
本文提出 Agent^2 RL-Bench,旨在评估 LLM 智能体能否自主设计、实现并运行完整的强化学习(RL)流程以改进基础模型。针对现有基准缺乏对交互式 RL 工程测试的问题,该基准涵盖从静态规则训练到闭环在线 RL 的六个任务层级。实验表明,智能体在特定任务(如 ALFWorld)上通过在线滚动能取得显著提升,但在其他任务上进展有限,且驱动模型的选择对结果影响巨大。研究揭示了在固定预算下监督流程的主导地位及在线 RL 的适用边界。
AI 推荐理由
论文核心研究 Agent 自主设计并执行 RL 流程以改进基础模型,属于典型的自我进化与自适应能力。
研究机构
Soochow University
Microsoft Research Asia
Peking University
Stony Brook University
The University of Chicago
论文信息