LLM Interpretability Reasoning Mechanism Cross-Architecture Analysis
摘要

理解大语言模型(LLM)的推理机制受限于输出可见但内部模式不透明的不对称性。单一探测方法易低估真实推理结构。为此,本文提出集成跨架构推理(IAR)框架,提供统一的推理可解释性方案。该方法结合带宽校准的互信息峰值与 Tukey IQR 检测定位关键推理 token,并通过重叠分析追踪其跨层轨迹,揭示计算密集度及演化规律。最后利用 Jaccard 稳定性指标验证 token 质量。在多种模型及数学、代码等领域的实验证明了该框架的泛化解释能力。

AI 推荐理由

论文提出 IAR 框架,专门用于解释和分析 LLM 的推理模式与内部机制,属核心研究。

研究机构
Tsinghua Shenzhen International Graduate School Harbin Institute of Technology, Shenzhen
论文信息
作者 Leonardo Matthew Yauw, Wei-Bin Kou, Yujiu Yang
发布日期 2026-05-27
arXiv ID 2605.28006
相关性评分 9/10 (高度相关)