tool-use mechanistic-interpretability agent-representation dependency-graph
摘要

本文研究了使用工具的 LLM Agent 在执行过程中形成的工具调用依赖图是否在模型内部有所表示。通过对 Qwen3-32B 残差流进行低容量边缘探测,发现能有效解码该依赖结构,且信号追踪的是抽象拓扑而非标识符值。实验在多个交互式多跳基准上复现了这一发现,并通过激活补丁技术证明该表示是传播而非被动读取的。这是首次针对 LLM Agent 运行时工具调用依赖图的结构化探测研究。

AI 推荐理由

论文核心研究 LLM Agent 工具调用依赖结构的内部表示机制,直接关联技能学习。

研究机构
约克大学计算机科学系
论文信息
作者 Tianda Sun, Dimitar Kazakov
发布日期 2026-05-25
arXiv ID 2605.25310
相关性评分 9/10 (高度相关)