Deep Research Dataset Reinforcement Learning Agent Planning
摘要

针对深度研究智能体缺乏高难度数据集及开源训练框架的瓶颈,本文构建了 DeepResearch-9K 数据集,包含 9000 个多难度层级问题及高质量搜索轨迹与推理链。同时,开发了支持多轮网页交互、多种强化学习方法及奖励模型的开源训练框架 DeepResearch-R1。实验表明,基于该数据集与框架训练的智能体在深度研究基准测试中取得了最先进成果。

AI 推荐理由

论文聚焦深度研究智能体的多步探索与复杂任务执行,核心在于规划能力。

研究机构
香港城市大学 百度公司 深圳技术大学
论文信息
作者 Tongzhou Wu, Yuhao Wang, Xinyu Ma, Xiuqiang He, Shuaiqiang Wang et al.
发布日期 2026-03-01
arXiv ID 2603.01152
相关性评分 9/10 (高度相关)