摘要
可验证奖励的强化学习(RLVR)虽提升了大语言模型的推理能力,但依赖外部监督。内部反馈强化学习(RLIF)作为可扩展的无监督替代方案,常因单一奖励导致奖励黑客或熵崩溃。本文提出多奖励 RLIF 框架,将训练信号分解为基于聚类投票的答案级奖励和基于令牌自确定性的完成级奖励。通过 GDPO 归一化平衡奖励尺度,并引入 KL-Cov 正则化防止后期熵崩溃。实验表明,该方法在数学推理和代码生成基准上显著提升了稳定性,性能接近监督式 RLVR,实现了无需外部真值监督的稳定长程推理。
AI 推荐理由
论文核心提出多奖励 RLIF 框架,旨在提升 LLM 在无监督下的数学与代码推理能力及稳定性。
研究机构
Bangladesh University of Engineering and Technology, Bangladesh
West Virginia University, USA
University of Aberdeen, UK
Fogosphere (Redev.AI Ltd, UK)
论文信息