摘要
大型语言模型常在简单计数任务中失败。本研究通过线性探测发现,模型内部层已近乎完美地编码了计数信息,但编码方向与输出头数字令牌行几乎正交,导致无法正确读出。这种“几何读取瓶颈”而非表示缺失是失败主因。实验表明,微调注意力权重可显著改善自回归生成中的计数表现,将正确数字的词汇排名大幅提升。该机制在多种计数任务中具有泛化性,但在复杂多步推理基准中未见此瓶颈。
AI 推荐理由
论文深入探究 LLM 计数推理失败的几何机制,属推理能力核心研究。
研究机构
Independent Researcher
论文信息