摘要
大型语言模型倾向于将推理过程外部化为思维链,使其成为监控的理想目标。本文通过“不透明串行深度”概念形式化该论点,定义为无需可解释中间步骤(如思维链)即可执行的最长计算长度。作者计算了 Gemma 3 模型的不透明串行深度数值上限,并推导了其他架构的渐近结果。此外,开源了一种自动计算任意神经网络深度上限的方法,证实混合专家模型深度可能低于稠密模型。结果表明,该指标是理解模型未外部化推理潜力的重要工具。
AI 推荐理由
论文核心研究思维链(CoT)作为推理外部化的必要性及理论界限,直接关联推理机制。
研究机构
Google DeepMind
论文信息