Reinforcement Learning Math Reasoning Data Efficiency Prompt Selection
摘要

强化学习已成为大语言模型推理任务后训练的关键。然而,扩展 rollout 带来的计算开销巨大,且许多提示贡献微弱梯度。本文研究发现样本效用非均匀且动态演变,最强学习信号集中于随训练移动的“学习边缘”。据此,提出 HIVE 框架,利用历史奖励轨迹进行粗选,并以提示熵为实时代理剪枝低效用实例。实验表明,该方法在多个数学推理基准上显著提升了 rollout 效率,同时未牺牲模型性能。

AI 推荐理由

论文核心针对大推理模型的 RL 训练效率,通过优化样本选择提升数学推理能力。

研究机构
Equal contribution Southern University of Science and Technology, Shenzhen, China The Hong Kong Polytechnic University, Hong Kong, China The Hong Kong University of Science and Technology, Hong Kong, China Nanyang Technological University, Singapore Rutgers University, New Jersey, USA
论文信息
作者 Jiahao Wu, Ning Lu, Shengcai Liu, Kun Wang, Yanting Yang et al.
发布日期 2026-03-26
arXiv ID 2603.25184
相关性评分 9/10 (高度相关)