摘要
语言模型常通过生成长推理链解决复杂任务,其中各步骤重要性不一。本文探究是通过模型内部还是推理链令牌来识别关键步骤。研究发现,模型激活比令牌包含更多识别重要推理步骤的信息。通过在激活上训练探针预测重要性,证明模型在生成后续步骤前已编码了步骤重要性的内部表示。该表示具有跨模型泛化性、分层分布性,且不与表面特征相关。结果表明,分析激活能揭示表面方法无法捕捉的推理层面。
AI 推荐理由
论文核心研究推理步骤重要性的内部编码机制,通过激活分析揭示推理本质。
研究机构
Techion
University of Zagreb
FER
MIT
论文信息