Tool Use Data Synthesis Agent Training Reinforcement Learning
摘要

开发多轮交互式工具使用智能体极具挑战,因用户需求复杂模糊,而智能体需执行确定性动作。为此,本文提出 CoVe(约束验证),一种用于训练此类智能体的后训练数据合成框架,旨在兼顾数据复杂性与正确性。CoVe 通过定义明确的任务约束,既引导复杂轨迹生成,又作为确定性验证器评估轨迹质量,从而为监督微调和强化学习提供高质量数据。在τ²-bench 基准上的评估显示,紧凑的 CoVe-4B 模型在航空和零售领域成功率显著优于同规模基线,甚至媲美大 17 倍的模型。

AI 推荐理由

论文核心在于训练交互式工具使用 Agent,提出约束引导验证框架以生成高质量工具调用数据。

研究机构
华为研究 独立研究员
论文信息
作者 Jinpeng Chen, Cheng Gong, Hanbo Li, Ziru Liu, Zichen Tian et al.
发布日期 2026-03-02
arXiv ID 2603.01940
相关性评分 9/10 (高度相关)