摘要
针对组相对策略优化(GRPO)在强化学习中信用分配粒度过粗的问题,本文提出利用隐藏状态分布信号提取局部推理质量。研究发现,正确与错误轨迹间隐藏状态分布的 Wasserstein 距离在推理分歧区域显著增大。据此,作者提出了跨度级隐藏状态增强优势重加权方法(SHEAR),通过该距离缩放令牌级优势,无需额外模型或标注即可实现细粒度监督。在数学推理和代码生成基准测试中,该方法显著优于标准 GRPO 及需监督的过程奖励模型。
AI 推荐理由
论文核心在于利用隐藏状态分布差异优化数学与代码推理中的细粒度信用分配,直接提升推理能力。
研究机构
北京邮电大学
论文信息