摘要
可验证奖励强化学习(RLVR)是提升大语言模型推理能力的有效范式,但现有算法常因熵坍缩导致过早确定性和优化不稳定。本文从 token 级熵流视角重审该问题,发现熵减 token 持续主导导致流动失衡。据此,提出在线策略熵流优化(OPEFO)机制,通过自适应重缩放熵增与熵减更新以平衡动态,同时保持严格在线策略。在六个数学推理基准上的实验表明,该方法显著提升了训练稳定性及最终性能。
AI 推荐理由
论文核心解决 RLVR 中熵坍缩问题,旨在提升 LLM 数学推理能力与训练稳定性。
研究机构
南洋理工大学,新加坡
上海交通大学,中国
论文信息