Tree Search Reinforcement Learning Tool Use Submodular Optimization
摘要

本文形式化了固定预算下的展开信息量(RIFB),证明独立采样器在困难提示下存在性能崩溃。为此,作者将中间状态选择重构为单调次模最大化问题,并提出不确定性感知置信上界(UUCB)。在此基础上,推出了 InfoTree 训练时树搜索框架,结合自适应预算分配器与异步推测扩展机制。实验表明,该方法在数学推理、网页搜索及代码生成等九个基准上显著优于现有基线,有效提升了样本效率与鲁棒性。

AI 推荐理由

论文提出基于树搜索的规划框架,核心解决工具使用中的轨迹选择与预算分配问题。

研究机构
Shanghai Jiao Tong University
论文信息
作者 Yuelin Hu, Zhenbo Yu, Zhengxue Cheng, Wei Liu, Li Song
发布日期 2026-05-06
arXiv ID 2605.05262
相关性评分 9/10 (高度相关)