Math Reasoning Sliding-Window Attention Reinforcement Learning Efficient Inference
摘要

针对长上下文推理需求与自注意力二次方复杂度之间的矛盾,本文提出 SWARR 方法,旨在将滑动窗口注意力(SWA)模型适配于数学推理任务。该方法包含两个阶段:首先通过监督微调高效转换预训练模型,随后利用强化学习进行策略适配以解决数据与架构不匹配问题。实验表明,该方案显著缩小了 SWA 与标准自注意力在数学基准上的性能差距,在保持线性复杂度效率优势的同时恢复了大部分精度,证明了强化学习对提升特定架构推理可行性的关键作用。

AI 推荐理由

论文核心研究数学推理任务中注意力架构的适配与优化,直接提升推理能力。

研究机构
上海人工智能实验室
论文信息
作者 Kai Liu, Peijie Dong, Xinchen Xie, Jianfei Gao, Qipeng Guo et al.
发布日期 2026-06-10
arXiv ID 2606.11634
相关性评分 9/10 (高度相关)