Tree Search LLM Reasoning MCTS Scalability
摘要

神经树搜索是游戏和强化学习中的强力决策算法。近期研究尝试将其应用于提升大语言模型(LLM)的推理能力,但发现存在扩展失效问题:随着搜索预算增加,GSM8K 和 Game24 上的准确率反而下降。本文提出 ReSCALE,一种改进的 Gumbel AlphaZero MCTS 方法,用 Gumbel 采样和顺序减半策略替代狄利克雷噪声及 PUCT 选择,在不改变模型或训练的前提下恢复了性能随预算增加的单调扩展性。实验表明,ReSCALE 在基线退化的预算下仍能达到优异效果,消融实验证实顺序减半是主要改进来源。

AI 推荐理由

论文核心解决 LLM 推理中搜索预算增加导致性能下降的问题,提出新算法恢复单调扩展。

研究机构
AXXXX, Moscow, Russia MIRAL, Moscow, Russia
论文信息
作者 Leonid Ugadiarov, Yuri Kuratov, Aleksandr Panov, Alexey Skrynnik
发布日期 2026-03-22
arXiv ID 2603.21162
相关性评分 9/10 (高度相关)