Long-Context Context Compression Efficient Inference Memory Architecture
摘要

针对大语言模型上下文窗口受限的瓶颈,本文提出 SharedLLM 框架。该架构由两个堆叠的短上下文模型组成:下层作为压缩器将长输入转化为多粒度紧凑表示,上层作为解码器进行处理。通过“自注入”机制,信息仅在底层传输以 bypass 冗余计算,并结合树状数据结构实现高效编码与查询感知检索。实验表明,仅在 8K 序列上训练的模型可有效泛化至 128K 以上输入,在长上下文基准测试中表现优异,同时显著降低显存占用并提升推理速度。

AI 推荐理由

提出多粒度压缩与自注入架构,核心解决长上下文记忆瓶颈。

研究机构
新加坡科技设计大学(SUTD),新加坡 新加坡管理大学(SMU),新加坡 新加坡国立大学(NUS),新加坡
论文信息
作者 Wei Han, Pan Zhou, Shuicheng Yan
发布日期 2026-03-05
arXiv ID 2603.04759
相关性评分 9/10 (高度相关)