数学推理 工具集成 延迟执行 强化学习
摘要

大型语言模型常利用工具调用增强推理能力,但现有方法通常将调用与即时执行紧密耦合,可能破坏推理连贯性并限制表达能力。为此,本文首次形式化了推理过程中工具调用与执行解耦的问题,引入带显式控制的延迟执行以增强工具集成推理(TIR)。此外,提出了分层控制框架,理论推导了代理损失函数,使隐式分层策略能学习等价于显式分层策略的行为,从而提出 IH-GRPO 算法。实验表明,该方法在多个域外数学推理基准上显著优于最强基线。

AI 推荐理由

论文核心解决工具集成下的数学推理问题,提出解耦机制显著提升推理性能。

研究机构
Meituan
论文信息
作者 Li Wang, Xiaohan Wang, Xiaodong Lu, Zipeng Zhang, Jinyang Wu et al.
发布日期 2026-05-18
arXiv ID 2605.18500
相关性评分 9/10 (高度相关)