摘要
理解大语言模型(LLM)的推理机制受限于输出可见但内部模式不透明的不对称性。单一探测方法易低估真实推理结构。为此,本文提出集成跨架构推理(IAR)框架,提供统一的推理可解释性方案。该方法结合带宽校准的互信息峰值与 Tukey IQR 检测定位关键推理 token,并通过重叠分析追踪其跨层轨迹,揭示计算密集度及演化规律。最后利用 Jaccard 稳定性指标验证 token 质量。在多种模型及数学、代码等领域的实验证明了该框架的泛化解释能力。
AI 推荐理由
论文提出 IAR 框架,专门用于解释和分析 LLM 的推理模式与内部机制,属核心研究。
研究机构
Tsinghua Shenzhen International Graduate School
Harbin Institute of Technology, Shenzhen
论文信息