Reinforcement Learning Reasoning Capability GRPO Training Efficiency
摘要

强化学习是解锁大模型推理能力的关键。针对现有 GRPO 方法在任务超出模型当前能力时因采样质量低导致训练停滞的问题,本文提出 FBOS-RL 框架。该方法利用环境反馈引导探索增强,并设计“利用导向策略对齐”与“探索导向能力培养”两个互补目标。实验表明,两者形成正向飞轮效应,显著提升了训练效率与最终推理性能上限,相比基线学习更快且策略熵更高。

AI 推荐理由

论文核心旨在通过改进 RL 训练机制,解决模型推理能力解锁受阻问题,直接提升推理性能上限。

研究机构
Hangzhou International Innovation Institute, Beihang University School of Artificial Intelligence, Beihang University Kuaishou Technology
论文信息
作者 Xikai Zhang, Yongzhi Li, Likang Xiao, Yingze Zhang, Yanhua Cheng et al.
发布日期 2026-05-18
arXiv ID 2605.20256
相关性评分 9/10 (高度相关)