RLVR 数学推理 低秩动力学 隐式过拟合 奇异值分解
摘要

近期研究表明,通过可验证奖励强化学习(RLVR)获得的增强推理能力主要集中在秩 -1 分量中。基于此,本文采用周期性秩 -1 替换法,发现 RLVR 存在对训练数据的隐式奖励过拟合现象:即使训练期间奖励较低,模型在测试集上仍表现良好。研究进一步刻画了 RL 训练的三个特性:有效秩 -1 分量仅保留数学推理能力;RLVR 本质是优化特定奇异谱,其线性层奇异值呈重尾分布;秩 -1 分量左奇异向量在训练中呈现更强对齐趋势,表明 RLVR 本质上优化了采样效率。这些发现揭示了 RLVR 塑造参数的机制,为改进持续学习范式提供了见解。

AI 推荐理由

论文核心研究 RLVR 如何塑造模型的数学推理能力及其低秩动力学机制。

研究机构
兰州大学 北京理工大学 清华大学
论文信息
作者 Hao Ye, Jisheng Dang, Junfeng Fang, Bimei Wang, Yizhou Zhang et al.
发布日期 2026-05-07
arXiv ID 2605.06523
相关性评分 9/10 (高度相关)