摘要
课程学习(CL)基于难度递增有助于泛化的直觉,广泛应用于大语言模型的预训练和后训练。然而,其在组合推理任务中的实际影响尚不明确。本文通过合成算术和逻辑基准,系统实证研究了后训练中的课程学习,其中难度由推理复杂度定义。研究发现,在不同模型家族和课程安排下,基于难度的排序相比随机采样在准确率或响应长度上均无显著优势。该结论在监督微调(SFT)和强化学习(RL)中均成立,挑战了基于课程的后训练在演绎推理中的实用性。
AI 推荐理由
论文核心研究课程学习对演绎推理和组合泛化的影响,直接针对推理能力。
研究机构
Max Planck Institute for Intelligent Systems, Tübingen
ETH Zürich
论文信息