摘要
为正确解读上下文并检索相关信息,大型语言模型必须将实体与其属性绑定,并在状态变化时更新这些绑定。本文通过因果干预分析 LLM 在动态状态追踪中如何实现该过程,识别出一种“检索条件重绑定机制”。这是一种紧凑的注意力头电路,能编码交换相关的绑定信息并在读取时恢复。研究发现该机制在 Gemma 和 Llama 模型中均支持重绑定行为,但其表征特征因模型家族而异:Gemma 主要在查询/键子空间表达,而 Llama 主要依赖键向量携带信息。
AI 推荐理由
论文核心研究 LLM 动态实体追踪中的记忆绑定与更新机制,属于记忆架构底层原理。
研究机构
Language Science and Technology, Saarland University
Max Planck Institute for Informatics
论文信息