摘要
大型语言模型在后训练阶段显著提升了推理能力,其中监督微调(SFT)广泛应用。然而,直接使用专家数据进行微调可能因数据分布与目标模型不匹配而损害泛化性能。本文提出“推理调优的数据适配”(DART)方法,将固定且可能分布错位的 SFT 数据集的使用形式化为演示变换的优化问题。DART 利用强化学习训练映射模型,将原始 SFT 数据转换为更符合目标模型分布和学习偏好的适配监督信号,随后用于 SFT 以提升外部监督的利用效率。多模型与多数据集实验表明,DART 有效提升了泛化能力,训练效率优于直接强化学习,并超越标准 SFT 效果。
AI 推荐理由
论文核心目标是提升 LLM 的推理泛化能力,提出 DART 方法优化 SFT 数据以增强推理表现。
研究机构
Beihang University
Tsinghua University
Nanyang Technological University
HANGZHOU International Innovation Institute
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing
论文信息