摘要
现有大语言模型可解释性方法通常将隐藏状态视为激活空间中的静态点,难以区分正确与错误推理。本文提出“真理即轨迹”(TaT)框架,将 Transformer 推理建模为迭代细化的展开轨迹,通过分析跨层表征的几何位移而非静态激活, uncover 区分有效推理与虚假行为的几何不变量。在常识推理、问答及毒性检测基准上的评估表明,TaT 有效 mitigates 对静态词汇混淆的依赖,优于传统探测方法,为 LLM 可解释性提供了互补视角。
AI 推荐理由
论文核心研究 LLM 推理过程的内部表征轨迹,提出新范式区分有效推理与虚假行为。
研究机构
澳大利亚机器学习研究所
澳大利亚国立大学
蒙纳士大学
康考迪亚大学
论文信息