摘要
本文探究了语言模型中工具选择失败的隐蔽性问题。通过对 12 个指令微调模型的探测,发现所选工具的身份在模型内部具有线性可读与可操控特性。利用工具间平均激活值的均值差向量,可在仅修改名称的情况下以高准确率切换工具选择,且生成的参数自动匹配新工具架构。研究进一步定位了导致该效应的因果方向及关键注意力头,并揭示预训练阶段已形成工具表征,而指令微调负责将其映射至输出。该成果为提前识别并纠正工具调用错误提供了新途径。
AI 推荐理由
论文核心研究工具调用的内部机制、可读性与可控性,直接决定 Agent 技能执行准确率。
研究机构
University College London
Holistic AI
Imperial College London
论文信息