摘要
基于 Transformer 的大语言模型在处理长输入时面临上下文窗口有限及预填充延迟高等挑战。现有扁平化处理或分块检索方法常浪费计算资源于无关文本,而离线 RAG 则引入额外存储开销。本文提出 H$^{2}$MT,通过构建离线语义层级结构,采用自底向上聚合生成节点记忆嵌入,并在推理阶段执行由粗到细的查询路由以早期剪枝无关分支。实验表明,该方法在多项长文本问答任务中,以更低的显存占用和首 token 延迟,实现了优于提示压缩及传统 RAG 基线的质量与效率平衡。
AI 推荐理由
论文提出分层记忆架构,核心解决长上下文记忆管理与检索效率问题。
研究机构
University of California, Los Angeles, USA
论文信息