RLVR Active Learning Reasoning Label Efficiency
摘要

大型语言模型在可验证奖励强化学习(RLVR)赋能下推理能力显著提升,但 RLVR 依赖昂贵的真实标签。无监督范式易导致训练崩溃且样本价值各异。本文提出主动可验证奖励强化学习(RLAVR),通过主动获取少量高价值样本的真实标签并结合伪标签,在有限标注预算下稳定训练并提升性能。为此,我们提出校正优势差距(CAG)指标以评估样本监督价值,并引入感知校正的可靠性估计(CARE)策略,将理论准则转化为实用的预查询获取政策。实验证明该方法在多领域及不同模型规模下均有效且通用。

AI 推荐理由

论文核心研究利用 RLVR 提升 LLM 推理能力,解决标签稀缺问题。

研究机构
Meituan Beihang University Nanyang Technological University
论文信息
作者 Li Wang, Xiaodong Lu, Xiaohan Wang, Yikun Ban, Jiajun Chai et al.
发布日期 2026-05-25
arXiv ID 2605.25864
相关性评分 9/10 (高度相关)