Chain-of-Thought Inference Acceleration KV Cache Compression Multi-token Prediction
摘要

尽管思维链(CoT)推理使大语言模型能够解决复杂问题,但随着生成 token 数量增加,KV 缓存线性增长导致速度和内存扩展受限。本文提出 MemoSight,一个统一框架,整合上下文压缩与多 token 预测技术,在保持 CoT 推理性能的同时缓解效率问题。该框架采用极简设计,通过特殊 token 及其 tailored 位置布局实现两种功能。在四个推理基准上的实验表明,MemoSight 将 KV 缓存占用减少高达 66%,推理速度提升 1.56 倍,且优于现有 CoT 压缩方法。

AI 推荐理由

论文核心解决思维链推理的效率瓶颈,通过压缩与多 token 预测加速推理过程。

研究机构
School of Computer Science and Engineering, Northeastern University, China Meituan Inc., China NiuTrans Research, Shenyang, China
论文信息
作者 Xinyu Liu, Xin Liu, Bo Jin, Runsong Zhao, Pengcheng Huang et al.
发布日期 2026-04-16
arXiv ID 2604.14889
相关性评分 9/10 (高度相关)