摘要
可验证奖励强化学习(RLVR)在培养大语言模型进行思维链推理方面成效显著,但在难以生成正确轨迹的复杂问题上样本效率低下。现有方法依赖监督微调(SFT),但数据成本高昂。本文提出 FEST 算法,仅需从 SFT 数据集中随机选取 128 个演示样本,结合监督信号、在线策略信号及衰减权重机制,有效防止过拟合。实验表明,FEST 在多个基准测试中以极少的数据量超越基线,甚至媲美全数据集训练效果,显著提升了模型在数学和编码任务中的推理能力。
AI 推荐理由
论文核心解决数学与代码任务中的思维链推理难题,通过改进 RLVR 提升推理样本效率。
研究机构
University of Illinois Urbana-Champaign
论文信息