摘要
针对大语言模型在数学推理强化学习中因奖励稀疏而难以获取有效反馈的问题,本文提出了参考引导微调(ReGFT)方法。该方法利用人类编写的参考解答合成正样本轨迹,通过提供部分参考引导模型生成符合其推理分布的解题路径。实验表明,ReGFT 能有效增加可解问题数量,加速训练并显著提升最终性能,成功克服了奖励稀疏障碍,解锁了更强的基于强化学习的数学推理能力。
AI 推荐理由
论文核心解决数学推理中的奖励稀疏问题,通过参考引导提升推理能力。
研究机构
ByteDance Seed
UC Berkeley
卡内基梅隆大学
论文信息