Reinforcement Learning Long-Context Sparse Updates Activation Patterns
摘要

强化学习是提升大语言模型推理能力的关键。本文发现处理长上下文时查询与键向量中存在高幅值激活,受量化及稀疏结构启发,提出 LongAct 策略。该方法从均匀更新转向显著性引导的稀疏更新,仅优化关键权重。实验显示,LongAct 在 LongBench v2 上提升约 8%,并增强 RULER 基准泛化性,且适用于多种 RL 算法,证实聚焦显著特征对释放长上下文潜力至关重要。

AI 推荐理由

论文核心旨在通过激活模式优化长上下文强化学习,直接提升 LLM 的推理能力。

研究机构
北京大学 上海交通大学 北京邮电大学
论文信息
作者 Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li et al.
发布日期 2026-04-16
arXiv ID 2604.14922
相关性评分 9/10 (高度相关)