摘要
可验证奖励强化学习(RLVR)是提升大语言模型推理能力的关键技术,但其响应级奖励如何转化为令牌级概率变化尚不明确。本文提出 DelTA 方法,将 RLVR 更新视为判别器,指出标准方法易受高频共享模式主导而稀释判别性方向。DelTA 通过估计令牌系数,放大特定侧的令牌梯度方向并抑制共享方向,从而重构更新策略。在七个数学基准测试中,该方法显著优于同规模基线,并在代码生成等任务中展现出良好的泛化能力。
AI 推荐理由
论文核心旨在通过改进 RLVR 中的令牌级奖励分配机制,显著提升大模型在数学等领域的推理能力。
研究机构
Gaoling School of Artificial Intelligence, Renmin University of China
Ait International
论文信息