摘要
蒙特卡洛树搜索(MCTS)是提升大语言模型推理性能的有效测试时计算扩展方法,但其执行时间波动大,导致严重的长尾延迟。现有优化如正向早期退出仅在有利情况下有效。本文提出“负向早期退出”机制以剪枝低效搜索轨迹,并引入“自适应增强机制”重新分配算力以减少并发搜索的资源竞争。集成至 vLLM 后,该方法在保持推理准确率的同时,显著降低了 P99 端到端延迟并提升了吞吐量。
AI 推荐理由
论文核心研究利用 MCTS 提升 LLM 推理性能及测试时计算扩展,直接针对推理能力优化。
研究机构
School of Computing, Korea Advanced Institute of Science and Technology, Daegu, South Korea
论文信息