RLVR 推理增强 在线剪枝 训练效率
摘要

可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力,但现有方法因依赖大量采样而计算成本高昂,且常因奖励信号稀疏导致学习效率低下。本文提出 arrol,一种在线 rollout 剪枝方法,通过在生成过程中动态剪枝并引导剩余样本平衡正确率,以增强学习信号。该方法利用轻量级质量头预测部分轨迹成功率进行早期剪枝,并在推理阶段加权候选项以提升准确率。实验表明,arrol 在多个模型上实现了训练加速与推理精度的双重提升。

AI 推荐理由

论文核心旨在通过优化 RLVR 训练过程,显著提升 LLM 的推理能力与准确率。

研究机构
University of Illinois at Urbana-Champaign
论文信息
作者 Haobo Xu, Sirui Chen, Ruizhong Qiu, Yuchen Yan, Chen Luo et al.
发布日期 2026-03-25
arXiv ID 2603.24840
相关性评分 9/10 (高度相关)