摘要
强化学习是解锁大模型推理能力的关键。针对现有 GRPO 方法在任务超出模型当前能力时因采样质量低导致训练停滞的问题,本文提出 FBOS-RL 框架。该方法利用环境反馈引导探索增强,并设计“利用导向策略对齐”与“探索导向能力培养”两个互补目标。实验表明,两者形成正向飞轮效应,显著提升了训练效率与最终推理性能上限,相比基线学习更快且策略熵更高。
AI 推荐理由
论文核心旨在通过改进 RL 训练机制,解决模型推理能力解锁受阻问题,直接提升推理性能上限。
研究机构
Hangzhou International Innovation Institute, Beihang University
School of Artificial Intelligence, Beihang University
Kuaishou Technology
论文信息