摘要
更宽的束搜索本应提升大语言模型推理能力,但本文指出其可能存在性能下降的临界点。基于极值理论,研究发现评分器噪声会导致系统性过估计偏差,且随候选池增大而加剧。作者推导出最大有效束宽公式,表明其取决于评分器的信噪比。实验验证显示,高噪声的困惑度评分导致最佳束宽为 1,而低噪声的过程奖励模型评分则支持更宽搜索并显著提升性能。
AI 推荐理由
论文核心研究束搜索对 LLM 推理质量的影响,揭示过估计偏差并推导最优束宽。
研究机构
NVIDIA Research
巴伊兰大学
格罗宁根大学
论文信息