摘要
本文研究了基于验证器的委员会搜索作为推理语言模型的推理时增强方法。研究证明,仅靠重复采样可扩大提议覆盖范围,但可靠的能力放大需结合执行、证明检查等局部可靠性信号。理论分析给出了排名界限,表明当局部选择误差可控时能形成可靠轨迹。实验显示,在 SWE-bench Verified 上,利用弱模型 GPT-5.4 nano 配合批评者 - 比较者编排,性能从 67.0% 提升至 76.4%,媲美顶尖强模型,证实主要挑战在于从弱模型生成的候选中筛选正确解。
AI 推荐理由
论文核心研究通过多智能体协作机制提升弱模型的推理能力,属于推理增强。
研究机构
Texas A&M University
MIT
论文信息