Benchmark Construction Tool Use Agent Evaluation Task Synthesis
摘要

随着 Agent 能力增强,现有基准测试趋于饱和且构建成本高昂。本文提出 TASTE,一种通过逆向任务构建过程自动生成高难度、广覆盖任务的方法。该方法利用自适应对比 n-gram 模型采样有效工具序列,经聚类筛选与迭代难度演化,构建了$τ^c$-Bench。实验表明,现有模型在新基准上性能显著下降,且新任务使独特工具组合数量翻倍,揭示了过去高分仅反映饱和而非鲁棒性,实现了可扩展的持续评估。

AI 推荐理由

论文核心在于通过生成多样化的工具序列来评估和提升 Agent 的工具使用技能覆盖度与难度。

研究机构
Faculty of Data and Decision Science, Technion IBM Research
论文信息
作者 Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer et al.
发布日期 2026-05-27
arXiv ID 2605.28556
相关性评分 9/10 (高度相关)