mechanistic interpretability linear probing reasoning modes format confounds
摘要

本文通过线性探测 Qwen3-14B 在演绎、归纳和溯因三类基准测试中的隐藏状态,发现高层准确率实由任务格式混淆驱动。去除格式变量后准确率降至随机水平,且因果干预显示几何结构与推理模式无功能联系。研究表明高探测精度反映的是任务格式而非计算结构,呼吁在机械可解释性研究中常规进行格式去混淆处理。

AI 推荐理由

论文核心探讨 LLM 隐藏状态中推理模式的表征机制,直接关联推理能力研究。

研究机构
Horizon Research Google Google DeepMind Northeastern University
论文信息
作者 Subramanyam Sahoo, Vinija Jain, Aman Chadha, Divya Chaudhary
发布日期 2026-06-01
arXiv ID 2606.02907
相关性评分 9/10 (高度相关)