Large Reasoning Models Sampling Strategies Exploration Math Reasoning Code Generation
摘要

大型推理模型在数学和编程等挑战性问题上表现卓越,但获取高质量解往往需多次采样。本文严谨对比了构成复杂过程的两种主要策略:顺序采样与并行采样。尽管顺序采样理论上具备更强的表示能力,实证却显示并行采样更优。通过在不同模型家族及领域上的实验,本文验证了三个假设,发现聚合算子与长上下文并非主因,而顺序采样因依赖先前答案导致探索不足,是造成性能差距的关键因素。

AI 推荐理由

论文核心研究大型推理模型中采样策略对推理性能的影响机制。

研究机构
Google DeepMind National University of Singapore
论文信息
作者 Xiangming Gu, Soham De, Larisa Markeeva, Petar Veličković, Razvan Pascanu
发布日期 2026-04-07
arXiv ID 2604.05868
相关性评分 9/10 (高度相关)