摘要
针对代理强化学习中缺乏可扩展执行环境及真实训练数据的瓶颈,本文提出 EnvFactory 框架。该框架能自动从真实资源中探索并验证有状态的可执行工具环境,并通过拓扑感知采样合成包含隐式意图的自然多轮轨迹。仅用少量环境即生成大量训练数据,显著提升了 Qwen3 系列模型在多项工具使用基准上的性能,为代理强化学习提供了可扩展且鲁棒的基础。
AI 推荐理由
论文核心解决 Agent 工具使用中的环境与数据瓶颈,直接提升技能学习效率。
研究机构
1LARK, HKUST (GZ)
2Huawei Technologies Co., Ltd
3University of Cambridge
4UCI
5HKUST
论文信息