摘要
随着 Agent 能力增强,现有基准测试趋于饱和且构建成本高昂。本文提出 TASTE,一种通过逆向任务构建过程自动生成高难度、广覆盖任务的方法。该方法利用自适应对比 n-gram 模型采样有效工具序列,经聚类筛选与迭代难度演化,构建了$τ^c$-Bench。实验表明,现有模型在新基准上性能显著下降,且新任务使独特工具组合数量翻倍,揭示了过去高分仅反映饱和而非鲁棒性,实现了可扩展的持续评估。
AI 推荐理由
论文核心在于通过生成多样化的工具序列来评估和提升 Agent 的工具使用技能覆盖度与难度。
研究机构
Faculty of Data and Decision Science, Technion
IBM Research
论文信息