摘要
本文发现思维链监督微调(CoT-SFT)虽提升推理能力,却系统性损害混合线性注意力模型的长上下文召回性能。在 Needle-In-A-Haystack 测试中,检索准确率显著下降,归因于 CoT-SFT 使注意力梯度偏向短程模式,破坏了负责长程路由的查询 - 键投影。为此,作者提出无需训练的 QK-Restore 方法,仅恢复预微调阶段的$W_Q$和$W_K$参数,有效重建长上下文能力并保持推理性能。
AI 推荐理由
论文核心研究长上下文记忆召回机制受损问题及修复方案,直接针对记忆架构。
研究机构
LARK, HKUST(GZ)
UCI
Mistral AI
Tsinghua University
SUTD
HKUST
论文信息