强化学习后训练 课程学习 推理能力提升 多臂老虎机 大语言模型
摘要

本文提出 ACTOR-CURATOR,一种可扩展且全自动的课程学习框架,用于大语言模型的强化学习后训练。该方法通过学习神经策展人,直接从大规模问题库中动态选择训练问题,以优化预期的策略性能提升。我们将问题选择建模为非平稳随机多臂老虎机问题,推导了基于在线随机镜像下降的原则性损失函数,并在部分反馈下建立了遗憾保证。实验表明,该方法在多个高难度推理基准上显著优于均匀采样及强基线课程方法,提升了训练稳定性与效率。

AI 推荐理由

论文通过课程学习优化 RL 后训练,显著提升数学与逻辑推理基准表现,核心聚焦推理能力增强。

研究机构
伊利诺伊大学芝加哥分校 NEC实验室美国 Caltech RPI MBZUAI 加州理工学院
论文信息
作者 Zhengyao Gu, Jonathan Light, Raul Astudillo, Ziyu Ye, Langzhou He et al.
发布日期 2026-02-24
arXiv ID 2602.20532
相关性评分 9/10 (高度相关)