摘要
工具集成推理(TIR)通过引入外部工具扩展了大语言模型的推理能力,但现有方法依赖外部文档,导致掌握困难、规模受限及效率低下。为此,本文探索工具内化推理(TInR),旨在将工具知识内化至模型中以促进推理。针对工具内化与协调挑战,提出了统一推理与工具使用的 TInR-U 框架。该框架通过三阶段流程训练:双向知识对齐实现工具内化、高质量标注监督微调预热,以及特定奖励的强化学习。实验表明,TInR-U 在域内和域外设置中均表现优异,兼具高效性与有效性。
AI 推荐理由
论文核心提出工具内化推理框架,旨在解决现有工具集成推理的局限,显著提升模型推理能力。
研究机构
香港理工大学
东南大学
爱丁堡大学
论文信息