Curriculum Learning Deductive Reasoning Post-training Compositional Generalization
摘要

课程学习(CL)基于难度递增有助于泛化的直觉,广泛应用于大语言模型的预训练和后训练。然而,其在组合推理任务中的实际影响尚不明确。本文通过合成算术和逻辑基准,系统实证研究了后训练中的课程学习,其中难度由推理复杂度定义。研究发现,在不同模型家族和课程安排下,基于难度的排序相比随机采样在准确率或响应长度上均无显著优势。该结论在监督微调(SFT)和强化学习(RL)中均成立,挑战了基于课程的后训练在演绎推理中的实用性。

AI 推荐理由

论文核心研究课程学习对演绎推理和组合泛化的影响,直接针对推理能力。

研究机构
Max Planck Institute for Intelligent Systems, Tübingen ETH Zürich
论文信息
作者 Maximilian Mordig, Andreas Opedal, Weiyang Liu, Bernhard Schölkopf
发布日期 2026-03-28
arXiv ID 2603.27226
相关性评分 9/10 (高度相关)