RLVR Sample Efficiency Gradient Gating LLM Reasoning
摘要

可验证奖励强化学习(RLVR)是大模型高级推理的主流范式,但采样成本高导致样本效率成为瓶颈。复用批次会加剧策略偏移从而降低性能。本文发现“不成比例权重发散”现象,即性能下降与 lm_head 权重剧增同步。据此提出动态梯度门控(DGG),通过实时监控 lm_head 梯度范数拦截有害梯度。实验表明,DGG 在数学及多任务场景中显著提升了样本效率和训练速度。

AI 推荐理由

论文针对 RLVR 推理范式,提出提升样本效率的核心方法,直接优化高级推理能力训练。

研究机构
National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University Meituan Longcat Team, The University of Sydney, University of Science and Technology of China
论文信息
作者 Yuchun Miao, Sen Zhang, Yuqi Zhang, Yaorui Shi, Qi Gu et al.
发布日期 2026-05-19
arXiv ID 2605.19425
相关性评分 9/10 (高度相关)