Tool-Integrated Reasoning Benchmark Tool Use Evaluation
摘要

工具集成推理(TIR)通过外部计算与执行能力增强大语言模型,但当前缺乏高质量统一基准。本文提出 TIDE-Bench,一个全面高效的评估基准。其优势包括:提供多样化任务设置,涵盖数学推理、知识问答及新设计的实验设计与动态交互任务,以探测复杂工具调用与多工具协调能力;采用任务感知的综合评估协议,衡量答案质量、过程可靠性、工具效率及推理成本;构建高区分度评估集,过滤低效样本以降低评估成本。实验揭示了现有模型在工具落地方面的瓶颈。

AI 推荐理由

论文核心评估工具集成推理,聚焦工具调用、协调及效率,属技能学习范畴。

研究机构
中国科学院软件研究所
论文信息
作者 Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang et al.
发布日期 2026-05-10
arXiv ID 2605.09544
相关性评分 9/10 (高度相关)