mechanistic interpretability arithmetic reasoning representation geometry causal intervention
摘要

本文研究了 Meta-Llama-3-8B 基座模型在单 Token 输出设定下的三位数加法任务,旨在刻画跨 Token 路由因果无关后算术答案的生成机制。通过因果残差修补和累积注意力消融实验,定位到第 17 层附近的sharp边界:此后解码和几乎完全由最后一个输入 Token 控制,晚期自注意力 largely 可省略。在此后路由机制下,数字方向字典随高位上下文变化,但在共享低秩子空间内通过近似正交映射紧密关联。因果数字编辑验证了该几何特性:朴素跨上下文迁移失败,而通过学习映射旋转方向可恢复严格的反事实编辑。

AI 推荐理由

论文深入剖析 LLM 执行算术推理的内部机制与表征几何,属核心研究。

研究机构
重庆师范大学认知智能与智能金融关键实验室 中国重庆市
论文信息
作者 Yao Yan
发布日期 2026-02-22
arXiv ID 2602.19109
相关性评分 9/10 (高度相关)