Tool Use Reinforcement Learning Environment Synthesis Data Generation
摘要

针对代理强化学习中缺乏可扩展执行环境及真实训练数据的瓶颈,本文提出 EnvFactory 框架。该框架能自动从真实资源中探索并验证有状态的可执行工具环境,并通过拓扑感知采样合成包含隐式意图的自然多轮轨迹。仅用少量环境即生成大量训练数据,显著提升了 Qwen3 系列模型在多项工具使用基准上的性能,为代理强化学习提供了可扩展且鲁棒的基础。

AI 推荐理由

论文核心解决 Agent 工具使用中的环境与数据瓶颈,直接提升技能学习效率。

研究机构
1LARK, HKUST (GZ) 2Huawei Technologies Co., Ltd 3University of Cambridge 4UCI 5HKUST
论文信息
作者 Minrui Xu, Zilin Wang, Mengyi DENG, Zhiwei Li, Zhicheng Yang et al.
发布日期 2026-05-18
arXiv ID 2605.18703
相关性评分 9/10 (高度相关)