mechanistic interpretability robustness mathematical reasoning activation patching
摘要

大语言模型在数学推理基准测试中表现优异,但对保义的表面扰动却表现出惊人的脆弱性。本文系统评估了三款开源模型在 GSM8K 数据集及其语义等价变体上的表现,发现答案翻转率高达 28.8%-45.1%。为此,我们提出了机械扰动诊断(MPD)框架,结合 Logit Lens、激活修补等技术,揭示了错误在不同架构中的局部化差异。基于此,我们构建了机械故障分类法,并通过定向修复实验验证了针对局部化故障的修复有效性显著高于分布式或纠缠式故障。

AI 推荐理由

论文核心研究 LLM 数学推理的脆弱性及其机械论基础,深入分析推理失败机制。

研究机构
Department of Computer Science, University of South Dakota
论文信息
作者 Shou-Tzu Han, Rodrigue Rizk, KC Santosh
发布日期 2026-04-02
arXiv ID 2604.01639
相关性评分 9/10 (高度相关)