摘要
本文提出块级引导生成(Chunk-Level Guided Generation),一种无需训练的创新方法,利用现成大语言模型作为过程评分器来指导小模型的数学推理。该方法在每一步采样固定长度的候选文本块,由大模型基于似然性进行评分并选择最优块,从而在错误传播前纠正推理路径。实验表明,该方法在多个数学基准测试中显著优于多数投票,并在匹配计算预算下媲美或超越需专门训练的奖励模型引导搜索,同时生成更短的推理轨迹。
AI 推荐理由
论文提出无需训练的块级引导生成方法,显著提升数学推理性能,核心聚焦推理过程优化。
研究机构
Department of Computer Science, University of Maryland
论文信息