摘要
可验证奖励的强化学习(RLVR)是提升大语言模型推理能力的主流范式,但其参数轨迹几何特性尚不明确。本文发现 RLVR 权重轨迹具有极低秩且高度可预测,主要性能增益可由参数增量的秩 -1 近似捕捉。据此提出 RELEX 方法,利用短观察窗口估计秩 -1 子空间并通过线性回归外推未来检查点,无需额外训练。实验表明,RELEX 仅需 15% 的训练步数即可达到或超越完整 RLVR 的性能,并能低成本外推至更远距离,其成功源于投影更新带来的“去噪”效应。
AI 推荐理由
论文核心研究通过 RLVR 提升 LLM 推理能力的训练轨迹几何特性及外推方法。
研究机构
University of Virginia
Washington University in St. Louis
论文信息