Multimodal Agent Task Planning Tool Use Reinforcement Learning
摘要

本文旨在开发具备显式推理规划、多工具调用及跨模态信息合成能力的多模态研究智能体。针对多模态搜索数据稀缺、有效搜索轨迹缺乏及在线 API 训练成本高昂三大挑战,提出基于超图的 Hyper-Search 数据生成方法;设计 DR-TTS 框架,通过任务分解优化专用工具专家,并利用树搜索重组专家以探索高效搜索轨迹;构建支持多工具的离线搜索引擎以实现低成本强化学习。实验表明,MM-DeepResearch 在多项基准测试中表现卓越。

AI 推荐理由

论文核心在于任务分解、搜索轨迹规划及多工具协同,显式强调推理与规划能力。

研究机构
中国科学院
论文信息
作者 Huanjin Yao, Qixiang Yin, Min Yang, Ziwang Zhao, Yibo Wang et al.
发布日期 2026-03-01
arXiv ID 2603.01050
相关性评分 9/10 (高度相关)