摘要
工具集成推理(TIR)通过外部计算与执行能力增强大语言模型,但当前缺乏高质量统一基准。本文提出 TIDE-Bench,一个全面高效的评估基准。其优势包括:提供多样化任务设置,涵盖数学推理、知识问答及新设计的实验设计与动态交互任务,以探测复杂工具调用与多工具协调能力;采用任务感知的综合评估协议,衡量答案质量、过程可靠性、工具效率及推理成本;构建高区分度评估集,过滤低效样本以降低评估成本。实验揭示了现有模型在工具落地方面的瓶颈。
AI 推荐理由
论文核心评估工具集成推理,聚焦工具调用、协调及效率,属技能学习范畴。
研究机构
中国科学院软件研究所
论文信息