Tool Use Reinforcement Learning Small Language Models Data Synthesis
摘要

现代工业应用亟需能在现实场景中执行多步推理和工具使用的代理语言模型,且需满足严格的成本与延迟约束。本文提出 AgenticQwen 模型家族,通过在合成数据及少量开源数据上进行多轮强化学习训练而成。该框架结合推理强化学习与代理强化学习,利用双数据飞轮自动生成日益复杂的任务:推理飞轮通过从错误中学习提升难度,代理飞轮则将线性工作流扩展为反映真实决策复杂度的多分支行为树。实验表明,该模型在多个代理基准测试中表现优异,并在工业系统中缩小了与大模型在搜索及数据分析任务上的差距。

AI 推荐理由

论文核心聚焦于训练小型模型进行工业级工具使用,通过强化学习提升多步推理与工具调用能力。

研究机构
阿里巴巴集团
论文信息
作者 Yuanjie Lyu, Chengyu Wang, Haonan Zheng, Yuanhao Yue, Junbing Yan et al.
发布日期 2026-04-23
arXiv ID 2604.21590
相关性评分 9/10 (高度相关)