Agent Training Tool Use Data Distillation ShoppingBench RLVR
摘要

小型模型智能体后训练受限于轨迹数据质量。现有数据源存在偏差或未过滤问题。本文提出构建激励对齐的智能体竞技场(基于 Bittensor ShoppingBench 子网),以生成多样化且经评判的多轮轨迹。通过结构质量过滤器筛选出真正的智能体轨迹(含工具调用),剔除子任务轨迹,并据此对 Qwen3-4B 进行后训练。实验显示,该方法将成功率从 18.0% 提升至 42.7%,接近合成数据基线,证明了利用竞技场轨迹蒸馏 Agent 技能的有效性。

AI 推荐理由

论文核心在于通过特定轨迹训练购物 Agent 的工具调用与任务执行技能,显著提升 ASR。

研究机构
ORO AI Dynamical Systems
论文信息
作者 Shardul Bansal, Seth Schilbe, Jarrod Barnes
发布日期 2026-06-08
arXiv ID 2606.10064
相关性评分 9/10 (高度相关)