Process Reward Agent Evolution Reinforcement Learning Search Agents
摘要

基于大语言模型的搜索代理主要依赖结果奖励训练,导致搜索过程缺乏监督,尤其在结果同质化时梯度消失。现有过程监督方法成本高或规则不一致且不可复用。本文提出 ARBOR,一种可复用的过程奖励框架,维护跨查询共享的规则记忆。该机制将对比轨迹生成的局部草稿整合为通用规则,并随策略演化更新。通过稀疏成对判断评分,为均匀结果奖励提供过程级梯度。实验表明,ARBOR 在四个多跳问答基准上显著优于基线,提升了判断准确率并有效转化了零梯度训练组。

AI 推荐理由

提出可复用规则缓冲机制,通过过程奖励驱动智能体策略持续自我进化与改进。

研究机构
清华大学 阿里巴巴集团 北京大学 深圳大学
论文信息
作者 Zheng Liu, Longxiang Zhang, Xintong Wang, Zhiang Xu, Shaoxiong Zhan et al.
发布日期 2026-06-02
arXiv ID 2606.03239
相关性评分 9/10 (高度相关)