摘要
大语言模型作为自主代理需决定何时直接回答或调用工具。现有研究常将工具必要性视为模型无关属性,忽视了不同模型能力边界的差异。本文提出基于模型实证表现的自适应工具必要性定义,并在算术与事实问答数据集中发现工具需求判断与实际调用行为存在显著错配。通过分解工具使用为内部认知与执行两阶段,并探测隐藏状态,研究发现错配主要集中于从认知到行动的转化过程,揭示了 LLM 工具使用中的“知行差距”,表明提升可靠性需同时优化需求识别与行动转化。
AI 推荐理由
核心研究 LLM 工具使用的决策机制,揭示认知与行动间的差距,直接关联技能学习。
研究机构
University of Maryland College Park
论文信息