LLM 可解释性 计数任务 表征学习 推理失败分析
摘要

大型语言模型在广泛推理基准上表现优异,却在重复令牌计数任务中频频失败。通常认为这是内部计数跟踪能力的局限,但本文证明该归因错误。研究发现,残差流中的线性探针能在所有层级以近乎完美的准确率解码正确计数,即便在模型输出错误答案的层级亦然。注意力模式未显示崩溃,分词伪影也非主因。实际上,特定格式触发的多层感知机模块在网络深处用固定错误答案覆盖了正确编码的计数。计数失败实为路由而非表征失败,两者需不同干预策略。

AI 推荐理由

论文深入剖析 LLM 计数失败的根本机制,揭示表征与输出的解离,属推理能力核心研究。

研究机构
Manipal Institute of Technology Bengaluru
论文信息
作者 Sohan Venkatesh
发布日期 2026-05-10
arXiv ID 2605.09239
相关性评分 9/10 (高度相关)