Reinforcement Learning Mathematical Reasoning Intrinsic Reward LLM Post-training
摘要

针对现有可验证奖励强化学习(RLVR)依赖黄金标签或特定领域验证器从而限制扩展性的问题,本文提出了无需验证器的内在梯度范数奖励(VIGOR)。该方法仅利用策略模型自身,通过对采样输出计算教师强制负对数似然梯度的$ℓ_2$范数作为内在偏好信号:梯度范数越小,表明输出与当前策略越对齐。为解决长度偏差并稳定训练,引入了$√T$缩放及组间排名整形技术。实验表明,在数学推理基准上,VIGOR 优于现有的内部反馈强化学习(RLIF)基线,并展现出向代码基准的跨域迁移能力,同时训练动态更稳定。

AI 推荐理由

论文提出无验证器 RL 方法,显著提升数学与代码推理能力,核心聚焦推理任务优化。

研究机构
Zhejiang University Ant Group
论文信息
作者 Xuexiang Wen, Hang Yu, Linchao Zhu, Gaoang Wang
发布日期 2026-05-11
arXiv ID 2605.09920
相关性评分 9/10 (高度相关)