摘要
大型语言模型常利用工具调用增强推理能力,但现有方法通常将调用与即时执行紧密耦合,可能破坏推理连贯性并限制表达能力。为此,本文首次形式化了推理过程中工具调用与执行解耦的问题,引入带显式控制的延迟执行以增强工具集成推理(TIR)。此外,提出了分层控制框架,理论推导了代理损失函数,使隐式分层策略能学习等价于显式分层策略的行为,从而提出 IH-GRPO 算法。实验表明,该方法在多个域外数学推理基准上显著优于最强基线。
AI 推荐理由
论文核心解决工具集成下的数学推理问题,提出解耦机制显著提升推理性能。
研究机构
Meituan
论文信息