mechanistic interpretability entity binding working memory probing
摘要

本文研究大语言模型如何在上下文中绑定并维持多个实体的属性关系。通过引入多槽位探测方法,解析单个令牌残差流激活,发现其包含正交的“当前实体”与“前序实体”槽位。前者用于事实检索,后者支持关系推理。研究表明,开源模型在处理单令牌多重绑定时表现不佳,而前沿模型已发展出更复杂的策略。结果揭示了激活中可用信息与模型实际利用信息之间的差距,为理解欺骗等行为提供了记忆结构基础。

AI 推荐理由

论文深入探究 LLM 内部实体绑定与多槽位记忆机制,揭示信息存储与利用的差异。

研究机构
Anthropic Fellows Program Anthropic
论文信息
作者 Paul C. Bogdan, Jack Lindsey
发布日期 2026-04-22
arXiv ID 2604.21139
相关性评分 9/10 (高度相关)