Multimodal Agent Deep Search Reinforcement Learning Tool Use
摘要

深度搜索已成为前沿多模态智能体的关键能力,但现有顶级模型难以复现。为此,本文提出 OpenSearch-VL,一套基于代理强化学习的开源训练方案。首先,构建了包含维基百科路径采样和视觉定位的高质量数据流水线,生成了 SFT 和 RL 数据集。其次,设计了统一文本搜索、图像处理等多种工具的多样化环境,支持主动感知与知识获取。最后,提出了多轮致命感知 GRPO 算法,通过掩码失败后令牌并保留前期推理,有效处理级联工具故障。该方案在七个基准测试中平均提升超 10 分,性能媲美商业模型。

AI 推荐理由

论文核心在于构建多模态搜索智能体的工具使用能力、环境交互及强化学习训练策略。

研究机构
Tencent Hunyuan University of California, Los Angeles The Chinese University of Hong Kong
论文信息
作者 Shuang Chen, Kaituo Feng, Hangting Chen, Wenxuan Huang, Dasen Dai et al.
发布日期 2026-05-06
arXiv ID 2605.05185
相关性评分 9/10 (高度相关)