Reinforcement Learning Agent Training Deep Research Scalability Virtual World
摘要

强化学习已成为训练大语言模型智能体的强大范式,但在深度研究领域面临合成数据无法激发真实搜索能力及实时搜索导致训练不稳定且成本高昂两大挑战。LiteResearcher 提出了一种可扩展的训练框架,通过构建映射真实搜索动态的轻量级虚拟世界,实现了持续优化的训练策略。该框架使小型搜索智能体在 GAIA 和 Xbench 基准测试中分别取得 71.3% 和 78.0% 的开源最先进成绩,超越了大型开源及商业模型,证明了可扩展强化学习是深度研究智能体的关键赋能技术。

AI 推荐理由

论文核心在于通过 RL 训练框架实现智能体的自我进化与持续改进,解决扩展性难题。

研究机构
浙江大学 Simplex AI 香港理工大学
论文信息
作者 Wanli Li, Bince Qu, Bo Pan, Jianyu Zhang, Zheng Liu et al.
发布日期 2026-04-20
arXiv ID 2604.17931
相关性评分 9/10 (高度相关)