On-Policy Distillation Mathematical Reasoning LLM Post-training
摘要

在线策略蒸馏(OPD)是一种数据高效的后训练方法,但在噪声环境下监督信号方差较高。为此,本文提出最佳 N 采样教师轨迹选择(BRTS)框架。该方法通过采样多个教师轨迹,依据“正确性优先、学生对齐次之”的原则筛选最优轨迹,并在教师上下文分支中提供可靠监督。实验表明,BRTS 在 AIME 和 AMC 等高难度数学推理基准上显著优于标准 OPD,尤其在困难数据集上增益最大。

AI 推荐理由

论文提出 BRTS 框架,旨在通过优化教师轨迹选择显著提升 LLM 在数学基准上的推理能力。

研究机构
Johns Hopkins University TikTok University of California, San Diego Purdue University
论文信息
作者 Ke Zhang, Yunjie Tian, DongDi Zhao, Yijiang Li, Yuanye Liu et al.
发布日期 2026-05-10
arXiv ID 2605.09725
相关性评分 9/10 (高度相关)