摘要
在线策略蒸馏(OPD)是一种数据高效的后训练方法,但在噪声环境下监督信号方差较高。为此,本文提出最佳 N 采样教师轨迹选择(BRTS)框架。该方法通过采样多个教师轨迹,依据“正确性优先、学生对齐次之”的原则筛选最优轨迹,并在教师上下文分支中提供可靠监督。实验表明,BRTS 在 AIME 和 AMC 等高难度数学推理基准上显著优于标准 OPD,尤其在困难数据集上增益最大。
AI 推荐理由
论文提出 BRTS 框架,旨在通过优化教师轨迹选择显著提升 LLM 在数学基准上的推理能力。
研究机构
Johns Hopkins University
TikTok
University of California, San Diego
Purdue University
论文信息