RLVR 数学推理 策略优化 梯度调制
摘要

可验证奖励的强化学习(RLVR)在大语言模型推理中效果显著,但面临资源分配不均与策略优化动态失衡的挑战。本文提出 DynaMO 框架:在序列层面,证明均匀分配非最优,推导基于伯努利方差的方差最小化分配策略;在 token 层面,开发梯度感知优势调制机制,补偿高置信度正确动作的梯度衰减,并利用熵变稳定更新幅度。在多种数学推理基准上的实验表明,该方法优于现有强基线。

AI 推荐理由

论文针对 LLM 数学推理任务,提出优化 RLVR 训练动态的新框架,显著提升推理能力。

研究机构
梅山大学 清华大学 复旦大学 北京大学
论文信息
作者 Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi et al.
发布日期 2026-02-22
arXiv ID 2602.19208
相关性评分 9/10 (高度相关)