Long-Context Attention Mechanism Fine-Tuning Memory Loss
摘要

本文发现思维链监督微调(CoT-SFT)虽提升推理能力,却系统性损害混合线性注意力模型的长上下文召回性能。在 Needle-In-A-Haystack 测试中,检索准确率显著下降,归因于 CoT-SFT 使注意力梯度偏向短程模式,破坏了负责长程路由的查询 - 键投影。为此,作者提出无需训练的 QK-Restore 方法,仅恢复预微调阶段的$W_Q$和$W_K$参数,有效重建长上下文能力并保持推理性能。

AI 推荐理由

论文核心研究长上下文记忆召回机制受损问题及修复方案,直接针对记忆架构。

研究机构
LARK, HKUST(GZ) UCI Mistral AI Tsinghua University SUTD HKUST
论文信息
作者 Xinyu Zhou, Boyu Zhu, Yi Xu, Zhiwei Li, Yingfa Chen et al.
发布日期 2026-06-09
arXiv ID 2606.11052
相关性评分 9/10 (高度相关)