mechanistic interpretability reasoning chains model activations probing
摘要

语言模型常通过生成长推理链解决复杂任务,其中各步骤重要性不一。本文探究是通过模型内部还是推理链令牌来识别关键步骤。研究发现,模型激活比令牌包含更多识别重要推理步骤的信息。通过在激活上训练探针预测重要性,证明模型在生成后续步骤前已编码了步骤重要性的内部表示。该表示具有跨模型泛化性、分层分布性,且不与表面特征相关。结果表明,分析激活能揭示表面方法无法捕捉的推理层面。

AI 推荐理由

论文核心研究推理步骤重要性的内部编码机制,通过激活分析揭示推理本质。

研究机构
Techion University of Zagreb FER MIT
论文信息
作者 Yaniv Nikankin, Martin Tutek, Tomer Ashuach, Jonathan Rosenfeld, Yonatan Belinkov
发布日期 2026-04-20
arXiv ID 2604.18307
相关性评分 9/10 (高度相关)