hidden-state analysis internal reasoning interpretability large reasoning models
摘要

大型推理模型(LRMs)生成长解决方案,但其轨迹是否反映实质内部计算尚不明确。本文研究了解码步骤和层间的隐藏状态转移,发现 LRMs 中存在独特的时空模式:成功轨迹表现出广泛的时间动态和局部层集中性。作者将此形式化为“潜在转移时空幅度”(StALT),这是一种无需训练的轨迹统计量。实验表明,StALT 能有效区分推理密集型任务中的正确与错误轨迹,并提供无标签的正确性信号。干预分析进一步证实该幅度与内部推理需求系统性相关,为理解 LLM 内部计算提供了实证依据。

AI 推荐理由

论文核心研究 LLM 内部推理过程的隐藏状态动态特征,提出新指标量化推理。

研究机构
Research and Development Group, Hitachi, Ltd., 1-280 Higashi-Koigakubo, Kokubunji-shi, Tokyo 185-8601, Japan
论文信息
作者 Kotaro Furuya, Takahito Tanimura
发布日期 2026-05-03
arXiv ID 2605.01853
相关性评分 9/10 (高度相关)