RLVR Credit Assignment Reasoning Eligibility Traces
摘要

可验证奖励强化学习(RLVR)是提升大语言模型推理能力的关键方法。然而,现有的无评论家算法(如 GRPO)依赖“均匀信用分配”假设,无法区分关键推理步骤,限制了学习效率。为此,本文提出选择性资格迹(S-trace)。该方法基于部分信任域保留直觉,首先引入 P-trace,进而构建 S-trace,通过选择性掩码低熵令牌实现稀疏资格迹机制,以降低方差并达成细粒度信用分配。实验表明,S-trace 在样本和令牌效率上均优于 GRPO,显著提升了模型的推理性能。

AI 推荐理由

论文核心旨在通过改进强化学习中的信用分配机制,显著提升大语言模型的推理能力。

研究机构
南方科技大学
论文信息
作者 Chaoli Mou, Zhan Zhuang, Xinning Chen, Yu Zhang
发布日期 2026-05-07
arXiv ID 2605.05965
相关性评分 9/10 (高度相关)