摘要
可验证奖励强化学习(RLVR)是提升大语言模型推理能力的关键方法。然而,现有的无评论家算法(如 GRPO)依赖“均匀信用分配”假设,无法区分关键推理步骤,限制了学习效率。为此,本文提出选择性资格迹(S-trace)。该方法基于部分信任域保留直觉,首先引入 P-trace,进而构建 S-trace,通过选择性掩码低熵令牌实现稀疏资格迹机制,以降低方差并达成细粒度信用分配。实验表明,S-trace 在样本和令牌效率上均优于 GRPO,显著提升了模型的推理性能。
AI 推荐理由
论文核心旨在通过改进强化学习中的信用分配机制,显著提升大语言模型的推理能力。
研究机构
南方科技大学
论文信息