Tool-Integrated Reasoning Math Reasoning Trust Calibration LLM Agents
摘要

大型推理模型虽经扩展测试时计算提升了性能,但在需精确计算的任务中仍存局限。工具集成推理(TIR)虽为有效范式,但现有模型在自身推理与工具结果冲突时,往往盲目自信而忽略正确的工具输出(即“工具被忽略”现象)。为此,本文提出自适应工具信任校准(ATTC)框架,依据生成代码块的置信度分数,引导模型自适应地选择信任或忽略工具结果。实验表明,该方法显著减少了“工具被忽略”现象,使多个开源 TIR 模型在不同数据集上的性能提升了 4.1% 至 7.5%。

AI 推荐理由

论文核心解决工具集成推理中模型对工具结果的信任校准问题,直接提升数学推理能力。

研究机构
华为技术有限公司
论文信息
作者 Ruotao Xu, Yixin Ji, Yu Luo, Jinpeng Li, Dong Li et al.
发布日期 2026-04-09
arXiv ID 2604.08281
相关性评分 9/10 (高度相关)