摘要
思维链(CoT)提示显著提升了大语言模型的推理能力,但长序列导致推理延迟和显存瓶颈。现有基于幅值的结构剪枝方法易陷入“幅值陷阱”,切断关键推理神经元,导致高稀疏度下推理能力崩溃。为此,本文提出相对动能效用(RKU)框架,基于交替梯度流将离散剪枝提升为连续动能积分,并利用 Fisher 迹归一化隔离负责逻辑路由的“动能尖峰”。实验表明,RKU 在 40% 稀疏度下显著优于基线,有效保留了分布外评估中的推理相关表示。
AI 推荐理由
论文核心解决 CoT 推理中的剪枝崩溃问题,提出新框架以保留推理能力。
研究机构
东南大学数学学院,中国南京 210096
论文信息