摘要
大型推理模型在数学和编程等挑战性问题上表现卓越,但获取高质量解往往需多次采样。本文严谨对比了构成复杂过程的两种主要策略:顺序采样与并行采样。尽管顺序采样理论上具备更强的表示能力,实证却显示并行采样更优。通过在不同模型家族及领域上的实验,本文验证了三个假设,发现聚合算子与长上下文并非主因,而顺序采样因依赖先前答案导致探索不足,是造成性能差距的关键因素。
AI 推荐理由
论文核心研究大型推理模型中采样策略对推理性能的影响机制。
研究机构
Google DeepMind
National University of Singapore
论文信息