Reinforcement Learning LLM Reasoning Off-Policy Learning Data Efficiency
摘要

传统的基于策略的可验证奖励强化学习(RLVR)框架存在经验浪费和奖励同质化问题,阻碍了大语言模型在后训练阶段对困难样本的学习效率。本文提出批量适应策略优化(BAPO),一种离线 RLVR 框架,旨在提高数据效率。该方法通过重新评估历史困难样本并复用高质量样本来动态选择训练批次,同时保证策略改进的下界。实验表明,BAPO 在数学、规划和视觉推理任务上平均优于 GRPO 12.5%,并成功解决了基线模型 consistently 失败的 40.7% 的问题。

AI 推荐理由

论文核心旨在通过离线强化学习提升 LLM 在数学、规划及视觉推理任务上的表现,直接针对推理能力优化。

研究机构
浙江大学 ByteDance Seed Robotics 中国南方电网 北京大学
论文信息
作者 Xu Wan, Yansheng Wang, Wenqi Huang, Mingyang Sun
发布日期 2026-02-24
arXiv ID 2602.20722
相关性评分 9/10 (高度相关)