Budget-Aware Tree Search Multi-hop Reasoning Test-time Scaling
摘要

针对测试时扩展中计算资源浪费问题,本文提出无需训练的预算感知价值树(BAVT)框架。该方法将多跳推理建模为动态搜索树,利用步级价值估计指导搜索,并引入预算条件节点选择机制,随资源消耗自适应调整探索与利用策略。此外,采用残差价值预测器克服模型自我评估的过度自信,实现无效工具调用的可靠剪枝。理论证明其在有限预算下的收敛性,实验表明在严格低预算下性能优于高资源基线。

AI 推荐理由

提出预算感知价值树搜索框架,核心优化多跳推理过程中的资源分配与路径选择。

研究机构
不列颠哥伦比亚大学 Vector Institute
论文信息
作者 Yushu Li, Wenlong Deng, Jiajin Li, Xiaoxiao Li
发布日期 2026-03-13
arXiv ID 2603.12634
相关性评分 9/10 (高度相关)