mathematical reasoning process supervision training-free LLM guidance
摘要

本文提出块级引导生成(Chunk-Level Guided Generation),一种无需训练的创新方法,利用现成大语言模型作为过程评分器来指导小模型的数学推理。该方法在每一步采样固定长度的候选文本块,由大模型基于似然性进行评分并选择最优块,从而在错误传播前纠正推理路径。实验表明,该方法在多个数学基准测试中显著优于多数投票,并在匹配计算预算下媲美或超越需专门训练的奖励模型引导搜索,同时生成更短的推理轨迹。

AI 推荐理由

论文提出无需训练的块级引导生成方法,显著提升数学推理性能,核心聚焦推理过程优化。

研究机构
Department of Computer Science, University of Maryland
论文信息
作者 Atoosa Chegini, Soheil Feizi
发布日期 2026-06-01
arXiv ID 2606.01682
相关性评分 9/10 (高度相关)