摘要
尽管思维链(CoT)推理使大语言模型能够解决复杂问题,但随着生成 token 数量增加,KV 缓存线性增长导致速度和内存扩展受限。本文提出 MemoSight,一个统一框架,整合上下文压缩与多 token 预测技术,在保持 CoT 推理性能的同时缓解效率问题。该框架采用极简设计,通过特殊 token 及其 tailored 位置布局实现两种功能。在四个推理基准上的实验表明,MemoSight 将 KV 缓存占用减少高达 66%,推理速度提升 1.56 倍,且优于现有 CoT 压缩方法。
AI 推荐理由
论文核心解决思维链推理的效率瓶颈,通过压缩与多 token 预测加速推理过程。
研究机构
School of Computer Science and Engineering, Northeastern University, China
Meituan Inc., China
NiuTrans Research, Shenyang, China
论文信息