摘要
工具增强推理常被视为提升 LLM Agent 性能的关键,但本文指出在语义干扰下,其表现未必优于原生思维链。通过提出因子化干预框架,研究隔离了提示格式成本、工具调用协议开销及执行收益,揭示了“工具使用税”现象:协议引入的退化往往抵消工具增益。为此,作者提出 G-STEP 轻量级推理门控以缓解错误,但结论强调根本改进仍需增强模型内在推理与交互能力。
AI 推荐理由
论文核心研究工具使用协议带来的性能损耗及优化,直接针对技能学习中的工具调用机制。
研究机构
University of Houston
University of Southern California
New York University
Texas A&M University
University of California, San Diego
论文信息