摘要
小型模型智能体后训练受限于轨迹数据质量。现有数据源存在偏差或未过滤问题。本文提出构建激励对齐的智能体竞技场(基于 Bittensor ShoppingBench 子网),以生成多样化且经评判的多轮轨迹。通过结构质量过滤器筛选出真正的智能体轨迹(含工具调用),剔除子任务轨迹,并据此对 Qwen3-4B 进行后训练。实验显示,该方法将成功率从 18.0% 提升至 42.7%,接近合成数据基线,证明了利用竞技场轨迹蒸馏 Agent 技能的有效性。
AI 推荐理由
论文核心在于通过特定轨迹训练购物 Agent 的工具调用与任务执行技能,显著提升 ASR。
研究机构
ORO AI
Dynamical Systems
论文信息