摘要
大型推理模型虽经扩展测试时计算提升了性能,但在需精确计算的任务中仍存局限。工具集成推理(TIR)虽为有效范式,但现有模型在自身推理与工具结果冲突时,往往盲目自信而忽略正确的工具输出(即“工具被忽略”现象)。为此,本文提出自适应工具信任校准(ATTC)框架,依据生成代码块的置信度分数,引导模型自适应地选择信任或忽略工具结果。实验表明,该方法显著减少了“工具被忽略”现象,使多个开源 TIR 模型在不同数据集上的性能提升了 4.1% 至 7.5%。
AI 推荐理由
论文核心解决工具集成推理中模型对工具结果的信任校准问题,直接提升数学推理能力。
研究机构
华为技术有限公司
论文信息