Reinforcement Learning Reasoning Token Credit Assignment Mathematical Reasoning
摘要

可验证奖励强化学习(RLVR)是提升大语言模型推理能力的关键技术,但其响应级奖励如何转化为令牌级概率变化尚不明确。本文提出 DelTA 方法,将 RLVR 更新视为判别器,指出标准方法易受高频共享模式主导而稀释判别性方向。DelTA 通过估计令牌系数,放大特定侧的令牌梯度方向并抑制共享方向,从而重构更新策略。在七个数学基准测试中,该方法显著优于同规模基线,并在代码生成等任务中展现出良好的泛化能力。

AI 推荐理由

论文核心旨在通过改进 RLVR 中的令牌级奖励分配机制,显著提升大模型在数学等领域的推理能力。

研究机构
Gaoling School of Artificial Intelligence, Renmin University of China Ait International
论文信息
作者 Kaiyi Zhang, Wei Wu, Yankai Lin
发布日期 2026-05-20
arXiv ID 2605.21467
相关性评分 9/10 (高度相关)