摘要
近期研究表明,交错或融合监督学习与强化学习信号的混合策略优化方法在大型语言模型推理任务中优于标准的“先 SFT 后 RL
AI 推荐理由
论文核心对比不同训练策略对 LLM 数学推理能力的影响,修正基线后确立 SFT-then-RL 优势。
研究机构
ETH AI Center, ETH Zürich
EPP
Allen Institute for AI
论文信息