摘要

近期研究表明,交错或融合监督学习与强化学习信号的混合策略优化方法在大型语言模型推理任务中优于标准的“先 SFT 后 RL

AI 推荐理由

论文核心对比不同训练策略对 LLM 数学推理能力的影响,修正基线后确立 SFT-then-RL 优势。

研究机构
ETH AI Center, ETH Zürich EPP Allen Institute for AI
论文信息
作者 Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin
发布日期 2026-04-26
arXiv ID 2604.23747
相关性评分 9/10 (高度相关)