Beam Search Reasoning Overestimation Bias Extreme Value Theory Test-Time Compute
摘要

更宽的束搜索本应提升大语言模型推理能力,但本文指出其可能存在性能下降的临界点。基于极值理论,研究发现评分器噪声会导致系统性过估计偏差,且随候选池增大而加剧。作者推导出最大有效束宽公式,表明其取决于评分器的信噪比。实验验证显示,高噪声的困惑度评分导致最佳束宽为 1,而低噪声的过程奖励模型评分则支持更宽搜索并显著提升性能。

AI 推荐理由

论文核心研究束搜索对 LLM 推理质量的影响,揭示过估计偏差并推导最优束宽。

研究机构
NVIDIA Research 巴伊兰大学 格罗宁根大学
论文信息
作者 Gal Dalal, Assaf Hallak, Gal Chechik, Yftach Ziser
发布日期 2026-03-16
arXiv ID 2603.15377
相关性评分 9/10 (高度相关)