摘要
近期研究表明,通过可验证奖励强化学习(RLVR)获得的增强推理能力主要集中在秩 -1 分量中。基于此,本文采用周期性秩 -1 替换法,发现 RLVR 存在对训练数据的隐式奖励过拟合现象:即使训练期间奖励较低,模型在测试集上仍表现良好。研究进一步刻画了 RL 训练的三个特性:有效秩 -1 分量仅保留数学推理能力;RLVR 本质是优化特定奇异谱,其线性层奇异值呈重尾分布;秩 -1 分量左奇异向量在训练中呈现更强对齐趋势,表明 RLVR 本质上优化了采样效率。这些发现揭示了 RLVR 塑造参数的机制,为改进持续学习范式提供了见解。
AI 推荐理由
论文核心研究 RLVR 如何塑造模型的数学推理能力及其低秩动力学机制。
研究机构
兰州大学
北京理工大学
清华大学
论文信息