摘要
本文通过线性探测 Qwen3-14B 在演绎、归纳和溯因三类基准测试中的隐藏状态,发现高层准确率实由任务格式混淆驱动。去除格式变量后准确率降至随机水平,且因果干预显示几何结构与推理模式无功能联系。研究表明高探测精度反映的是任务格式而非计算结构,呼吁在机械可解释性研究中常规进行格式去混淆处理。
AI 推荐理由
论文核心探讨 LLM 隐藏状态中推理模式的表征机制,直接关联推理能力研究。
研究机构
Horizon Research
Google
Google DeepMind
Northeastern University
论文信息