摘要
群组相对策略优化(GRPO)虽能有效扩展大语言模型推理能力,但其基于群组的采样需求导致计算成本过高。现有选择性数据利用方法虽可缓解开销,却可能因改变采样分布而引入估计偏差。为此,本文提出动态剪枝策略优化(DPPO),通过基于重要性采样的校正实现无偏梯度估计的动态剪枝。结合数学推导的重缩放因子,DPPO 在不改变全批量基线优化目标的前提下显著加速训练。此外,引入密集提示打包策略以缓解剪枝导致的数据稀疏问题。实验表明,DPPO 在多种模型和基准上均实现一致加速,如在 MATH 数据集上训练 Qwen3-4B 时,训练速度提升 2.37 倍,六个数学推理基准平均准确率超越 GRPO 3.36%。
AI 推荐理由
论文提出 DPPO 框架优化 GRPO,显著提升数学推理任务训练效率与准确率,核心针对推理能力。
研究机构
清华大学
中国科学院自动化研究所
论文信息