摘要
神经树搜索是游戏和强化学习中的强力决策算法。近期研究尝试将其应用于提升大语言模型(LLM)的推理能力,但发现存在扩展失效问题:随着搜索预算增加,GSM8K 和 Game24 上的准确率反而下降。本文提出 ReSCALE,一种改进的 Gumbel AlphaZero MCTS 方法,用 Gumbel 采样和顺序减半策略替代狄利克雷噪声及 PUCT 选择,在不改变模型或训练的前提下恢复了性能随预算增加的单调扩展性。实验表明,ReSCALE 在基线退化的预算下仍能达到优异效果,消融实验证实顺序减半是主要改进来源。
AI 推荐理由
论文核心解决 LLM 推理中搜索预算增加导致性能下降的问题,提出新算法恢复单调扩展。
研究机构
AXXXX, Moscow, Russia
MIRAL, Moscow, Russia
论文信息