Reinforcement Learning Agentic Search Reasoning Enhancement Experience Replay
摘要

强化学习已成为通过整合外部搜索引擎提升大语言模型推理能力的有效方法。然而,现有基于强化学习的搜索代理常依赖精心设计的结果奖励引导随机探索,导致推理轨迹低效且训练不稳定。为此,本文提出分层经验(HiExp)框架,通过对比分析和多级聚类机制提取实证知识,将原始推理轨迹转化为分层经验知识。利用经验对齐训练,有效规范随机探索,使其演变为战略性的经验驱动搜索过程。在多个复杂代理搜索和数学推理基准上的评估表明,该方法不仅显著提升性能,还展现出强大的跨任务和跨算法泛化能力。

AI 推荐理由

论文核心在于通过分层经验机制提升基于搜索的代理推理能力,解决随机探索导致的低效问题。

研究机构
Alibaba Cloud Computing
论文信息
作者 Chuzhan Hao, Wenfeng Feng, Guochao Jiang, Guofeng Quan, Guohua Liu et al.
发布日期 2026-04-09
arXiv ID 2604.08124
相关性评分 9/10 (高度相关)