Tool-Integrated Reasoning Knowledge Internalization Reinforcement Learning
摘要

工具集成推理(TIR)通过引入外部工具扩展了大语言模型的推理能力,但现有方法依赖外部文档,导致掌握困难、规模受限及效率低下。为此,本文探索工具内化推理(TInR),旨在将工具知识内化至模型中以促进推理。针对工具内化与协调挑战,提出了统一推理与工具使用的 TInR-U 框架。该框架通过三阶段流程训练:双向知识对齐实现工具内化、高质量标注监督微调预热,以及特定奖励的强化学习。实验表明,TInR-U 在域内和域外设置中均表现优异,兼具高效性与有效性。

AI 推荐理由

论文核心提出工具内化推理框架,旨在解决现有工具集成推理的局限,显著提升模型推理能力。

研究机构
香港理工大学 东南大学 爱丁堡大学
论文信息
作者 Qiancheng Xu, Yongqi Li, Fan Liu, Hongru Wang, Min Yang et al.
发布日期 2026-04-12
arXiv ID 2604.10788
相关性评分 9/10 (高度相关)