Long-Context Context Compression Code Reasoning Attention Mechanism
摘要

随着实际应用需处理超 10 万 token 输入,上下文长度与推理效率间的差距成为关键瓶颈。现有无训练注意力压缩方法在代码推理等复杂任务中表现不足。本文提出 LongAttnComp,通过微调轻量级交叉注意力评分层,引入令牌级分块、基于预算的 top-p 算法及位置重排序等技术。采用两阶段微调策略:第一阶段构建通用检索基础,第二阶段扩展多跳与推理数据以覆盖更广任务。实验表明,该方法在 InfiniteBench 代码调试任务中匹配或超越全上下文精度,显著优于无训练基线,并在多文档推理中有效缩小性能差距。

AI 推荐理由

论文核心解决长上下文下的代码推理与多跳推理瓶颈,通过压缩技术提升推理效率与准确率。

研究机构
SambaNova Systems, Inc.
论文信息
作者 Mengmeng Ji, Ravi Shanker Raju, Jonathan Lingjie Li, Chen Wu
发布日期 2026-05-31
arXiv ID 2606.01336
相关性评分 9/10 (高度相关)