RLVR Entropy Collapse Mathematical Reasoning LLM Training
摘要

可验证奖励强化学习(RLVR)是提升大语言模型推理能力的有效范式,但现有算法常因熵坍缩导致过早确定性和优化不稳定。本文从 token 级熵流视角重审该问题,发现熵减 token 持续主导导致流动失衡。据此,提出在线策略熵流优化(OPEFO)机制,通过自适应重缩放熵增与熵减更新以平衡动态,同时保持严格在线策略。在六个数学推理基准上的实验表明,该方法显著提升了训练稳定性及最终性能。

AI 推荐理由

论文核心解决 RLVR 中熵坍缩问题,旨在提升 LLM 数学推理能力与训练稳定性。

研究机构
南洋理工大学,新加坡 上海交通大学,中国
论文信息
作者 Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu
发布日期 2026-05-12
arXiv ID 2605.11491
相关性评分 9/10 (高度相关)