Reinforcement Learning Budget Allocation Agentic Reasoning Tree Search
摘要

针对可验证奖励强化学习(RLVR)中因提示词难度不当或仅依赖结果奖励导致的奖励对比度不足问题,本文提出 TRACE 框架。该方法将多轮代理交互建模为树状结构,把预算分配从提示词层级细化至中间前缀层级。通过共享预测器估计条件成功概率,TRACE 动态分配资源给最可能产生混合奖励的节点,从而在固定采样预算下增强反馈信号。实验表明,该方法在多项代理基准测试中显著提升了效率与性能。

AI 推荐理由

论文核心旨在通过优化 RL 采样预算增强 LLM 的推理与代理行为,直接提升推理能力。

研究机构
腾讯计算机系统有限公司
论文信息
作者 Heming Zou, Qi Wang, Yun Qu, Yuhang Jiang, Lizhou Cai et al.
发布日期 2026-06-09
arXiv ID 2606.11119
相关性评分 9/10 (高度相关)