摘要
可验证奖励强化学习(RLVR)显著提升了大语言模型的推理能力,但现有方法因依赖大量采样而计算成本高昂,且常因奖励信号稀疏导致学习效率低下。本文提出 arrol,一种在线 rollout 剪枝方法,通过在生成过程中动态剪枝并引导剩余样本平衡正确率,以增强学习信号。该方法利用轻量级质量头预测部分轨迹成功率进行早期剪枝,并在推理阶段加权候选项以提升准确率。实验表明,arrol 在多个模型上实现了训练加速与推理精度的双重提升。
AI 推荐理由
论文核心旨在通过优化 RLVR 训练过程,显著提升 LLM 的推理能力与准确率。
研究机构
University of Illinois at Urbana-Champaign
论文信息