摘要
近年来,大语言模型在解决数学和编程等复杂推理任务方面取得了显著进展。当面对无法一次性解决的更难任务时,构建能够辅助解题的中间“垫脚石”(如简化问题、替代框架或子问题)至关重要。本文通过 ARQ 框架,在默认推理流程中引入问题生成器,研究了现代推理大模型中垫脚石的属性与优势。研究表明,优质的垫脚石问题不仅存在且具有可迁移性,能显著提升不同能力模型的任务表现。此外,文章将垫脚石生成定义为后训练任务,证明可通过监督微调和强化学习在合成数据上微调模型,以生成更有用的垫脚石。
AI 推荐理由
论文核心研究通过生成中间“垫脚石”问题来增强 LLM 解决复杂推理任务的能力,直接针对推理机制。
研究机构
FAIR at Meta
斯坦福大学
牛津大学
论文信息