摘要
强化学习是提升大语言模型推理能力的关键。本文发现处理长上下文时查询与键向量中存在高幅值激活,受量化及稀疏结构启发,提出 LongAct 策略。该方法从均匀更新转向显著性引导的稀疏更新,仅优化关键权重。实验显示,LongAct 在 LongBench v2 上提升约 8%,并增强 RULER 基准泛化性,且适用于多种 RL 算法,证实聚焦显著特征对释放长上下文潜力至关重要。
AI 推荐理由
论文核心旨在通过激活模式优化长上下文强化学习,直接提升 LLM 的推理能力。
研究机构
北京大学
上海交通大学
北京邮电大学
论文信息