Multi-Agent System Deep Research Reinforcement Learning Task Planning
摘要

本文提出 Mind DeepResearch (MindDR),一种高效的多智能体深度研究框架。其核心创新在于包含规划、深度搜索和报告三个智能体的协作架构,以及涵盖监督微调冷启动、搜索强化学习、报告强化学习和偏好对齐的四阶段专用训练流程。该框架使约 300 亿参数模型在多个基准测试中达到领先性能,超越同规模开源系统并媲美更大规模模型。此外,文章还介绍了基于真实用户交互构建的 MindDR Bench 基准测试集。

AI 推荐理由

论文核心为三智能体架构,其中规划智能体及多阶段训练流程是关键创新。

研究机构
Li Auto Inc
论文信息
作者 MindDR Team, Li Auto Inc
发布日期 2026-04-16
arXiv ID 2604.14518
相关性评分 9/10 (高度相关)