摘要
针对大语言模型上下文窗口受限的瓶颈,本文提出 SharedLLM 框架。该架构由两个堆叠的短上下文模型组成:下层作为压缩器将长输入转化为多粒度紧凑表示,上层作为解码器进行处理。通过“自注入”机制,信息仅在底层传输以 bypass 冗余计算,并结合树状数据结构实现高效编码与查询感知检索。实验表明,仅在 8K 序列上训练的模型可有效泛化至 128K 以上输入,在长上下文基准测试中表现优异,同时显著降低显存占用并提升推理速度。
AI 推荐理由
提出多粒度压缩与自注入架构,核心解决长上下文记忆瓶颈。
研究机构
新加坡科技设计大学(SUTD),新加坡
新加坡管理大学(SMU),新加坡
新加坡国立大学(NUS),新加坡
论文信息