Reinforcement Learning Entropy Control Reasoning Capabilities Performance Saturation
摘要

强化学习(RL)虽激发了大语言模型的复杂推理能力,但常因熵崩溃导致性能饱和。本文提出 Entrocraft,一种简单的拒绝采样方法,通过偏置优势分布实现任意自定义的熵调度,无需目标正则化。理论分析揭示了单步熵变与优势分布的关系。实证表明,线性退火策略效果最佳。该方法显著提升了泛化性、输出多样性及长期训练稳定性,使 4B 模型超越 8B 基线,并将 pass@K 指标提高 50%。

AI 推荐理由

论文核心解决 RL 训练中推理能力饱和问题,通过熵控制提升复杂推理性能。

研究机构
Purdue University West Lafayette, IN USA
论文信息
作者 Bolian Li, Yifan Wang, Yi Ding, Anamika Lochab, Ananth Grama et al.
发布日期 2026-04-29
arXiv ID 2604.26326
相关性评分 9/10 (高度相关)