摘要
大语言模型在字符计数等基础符号任务上常表现失败,尽管其在复杂基准测试中优异。本文通过机械分析发现,模型内部虽能正确计算答案,但后期层(尤其是倒数第二和最终层 MLP)中的“负向电路”会抑制正确信号,偏好高概率的错误输出。研究表明,符号推理失败源于计算图内的结构化干扰而非表示缺失,并揭示了前向传播中存在竞争性解码机制,即正确与错误假设共存并通过动态重加权决定最终输出。
AI 推荐理由
核心研究 LLM 符号推理失败的内部机制,揭示计算图中的干扰导致推理错误。
研究机构
IIIT Hyderabad
Goethe University, Frankfurt am Main, Germany
University of Sheffield, UK
论文信息