RLVR Chain-of-Thought Sample Efficiency Math Reasoning Few-Shot Learning
摘要

可验证奖励强化学习(RLVR)在培养大语言模型进行思维链推理方面成效显著,但在难以生成正确轨迹的复杂问题上样本效率低下。现有方法依赖监督微调(SFT),但数据成本高昂。本文提出 FEST 算法,仅需从 SFT 数据集中随机选取 128 个演示样本,结合监督信号、在线策略信号及衰减权重机制,有效防止过拟合。实验表明,FEST 在多个基准测试中以极少的数据量超越基线,甚至媲美全数据集训练效果,显著提升了模型在数学和编码任务中的推理能力。

AI 推荐理由

论文核心解决数学与代码任务中的思维链推理难题,通过改进 RLVR 提升推理样本效率。

研究机构
University of Illinois Urbana-Champaign
论文信息
作者 Kai Yan, Alexander G. Schwing, Yu-Xiong Wang
发布日期 2026-05-14
arXiv ID 2605.15012
相关性评分 9/10 (高度相关)