摘要
近期基于可验证奖励的强化学习(RLVR)显著提升了大语言模型的推理能力,但模型常难以探索初始潜在空间之外的新轨迹。针对现有离线教师引导与熵驱动策略缺乏深度融合的问题,本文提出 OGER 框架。该框架通过专用奖励建模视角,统一了离线教师引导与在线强化学习。OGER 采用多教师协同训练,构建辅助探索奖励,利用离线轨迹与模型自身熵值激励自主探索。实验表明,OGER 在数学与通用推理基准上显著优于基线,既大幅提升了数学推理性能,又保持了对域外任务的鲁棒泛化能力。
AI 推荐理由
论文核心旨在通过强化学习提升 LLM 在数学及通用领域的推理能力,直接针对推理瓶颈。
研究机构
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China
Hithink RoyalFlush Information Network, Hangzhou, China
Computer and Information Science, University of Macau, Macao, China
论文信息