摘要
深度搜索已成为前沿多模态智能体的关键能力,但现有顶级模型难以复现。为此,本文提出 OpenSearch-VL,一套基于代理强化学习的开源训练方案。首先,构建了包含维基百科路径采样和视觉定位的高质量数据流水线,生成了 SFT 和 RL 数据集。其次,设计了统一文本搜索、图像处理等多种工具的多样化环境,支持主动感知与知识获取。最后,提出了多轮致命感知 GRPO 算法,通过掩码失败后令牌并保留前期推理,有效处理级联工具故障。该方案在七个基准测试中平均提升超 10 分,性能媲美商业模型。
AI 推荐理由
论文核心在于构建多模态搜索智能体的工具使用能力、环境交互及强化学习训练策略。
研究机构
Tencent Hunyuan
University of California, Los Angeles
The Chinese University of Hong Kong
论文信息