mechanistic interpretability symbolic reasoning negative circuits competitive decoding
摘要

大语言模型在字符计数等基础符号任务上常表现失败,尽管其在复杂基准测试中优异。本文通过机械分析发现,模型内部虽能正确计算答案,但后期层(尤其是倒数第二和最终层 MLP)中的“负向电路”会抑制正确信号,偏好高概率的错误输出。研究表明,符号推理失败源于计算图内的结构化干扰而非表示缺失,并揭示了前向传播中存在竞争性解码机制,即正确与错误假设共存并通过动态重加权决定最终输出。

AI 推荐理由

核心研究 LLM 符号推理失败的内部机制,揭示计算图中的干扰导致推理错误。

研究机构
IIIT Hyderabad Goethe University, Frankfurt am Main, Germany University of Sheffield, UK
论文信息
作者 Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi
发布日期 2026-04-01
arXiv ID 2604.00778
相关性评分 9/10 (高度相关)