RLVR Entropy Regularization LLM Reasoning Exploration Strategy
摘要

可验证奖励的强化学习(RLVR)显著提升了大语言模型的推理能力,但面临“受限探索”的根本局限,即策略迅速收敛至狭窄解集。针对现有熵正则化方法的不稳定性,本文提出重思策略熵与探索的关系,将熵分解为保留多样解路的“信息熵”和侵蚀推理模式的“虚假熵”。研究揭示有效探索需进行“熵细化”,即在正样本中维持信息熵而在负样本中抑制虚假熵。据此提出的 AsymGRPO 框架通过解耦正负滚动的熵调制,实现了 superior 的推理性能。

AI 推荐理由

论文核心解决 RLVR 中推理能力受限问题,提出熵细化机制以增强多样化解路径。

研究机构
北卡罗来纳州立大学 凯斯西储大学
论文信息
作者 Hengrui Gu, Xiaotian Han, Yujing Bian, Kaixiong Zhou
发布日期 2026-04-06
arXiv ID 2604.04894
相关性评分 9/10 (高度相关)