摘要
工具集成推理(TIR)能突破纯文本推理的局限,但研究发现即使极少调用工具,评估性能也可能下降。本文提出了一套完整的 TIR 训练方案,旨在向强思维模型注入自然工具使用行为而不牺牲其无工具推理能力。关键发现包括:监督微调需优先选择适合工具增强的问题;控制工具轨迹比例可缓解灾难性遗忘;优化 pass@k 和响应长度而非训练损失能最大化收益;基于合适初始化的稳定强化学习阶段效果显著。该方案在 Qwen3 模型上取得了开源领域的最先进性能。
AI 推荐理由
论文核心研究如何通过工具集成增强思维模型的推理能力,解决性能退化问题。
研究机构
中国科学院大学
上海交通大学
论文信息