摘要
长思维链(CoT)推理对模型成功至关重要,但面临高计算开销和延迟问题。现有外部压缩方法常因无法对齐模型内部推理动态而丢失关键逻辑步骤。本文提出 CRISP 框架,利用模型内在显著性进行压缩。研究发现推理终止标记充当信息锚点,其注意力模式能有效区分必要推理与冗余。基于此,CRISP 利用内在注意力信号指导原子级压缩操作,在最大化信息密度的同时保持逻辑连贯。实验表明,该方法在多种模型和数学数据集上减少了 50-60% 的令牌数量且未牺牲准确率,有效缓解了长上下文推理的效率瓶颈。
AI 推荐理由
论文核心研究思维链(CoT)的压缩机制,直接优化推理过程的效率与逻辑连贯性。
研究机构
南京航空航天大学人工智能学院,南京,中国
论文信息