Chain-of-Thought Memory Compression Efficient Reasoning Hybrid Training
摘要

扩展的思维链(CoT)轨迹虽能提升大语言模型推理能力,但带来巨大的计算与内存开销。现有压缩方法因丢失细粒度信息导致后续步骤易出错。为此,本文提出 HybridThinker,在保留压缩表示的同时暂时存储思维步骤以提供细节。针对训练中模型可能绕过记忆令牌的问题,引入混合训练方案,部分掩码思维步骤,强制模型学习通过记忆令牌进行压缩与检索。实验表明,该方法在四个推理基准上匹配未压缩基线,平均准确率提升 5.8%,且推理时间相当。

AI 推荐理由

论文核心提出混合训练方案以优化思维链推理,直接提升推理效率与准确率。

研究机构
School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China
论文信息
作者 Xin Liu, Runsong Zhao, Xinyu Liu, Junhao Ruan, Pengcheng Huang et al.
发布日期 2026-06-02
arXiv ID 2606.03768
相关性评分 9/10 (高度相关)