摘要
针对现有大模型局限于单模态或缺乏实时网络信息获取能力的问题,本文提出 VSearcher,一种基于强化学习的长程多模态搜索智能体。该研究构建了迭代注入数据合成流水线以生成高质量多模态问答数据,并采用“监督微调加强化学习”的训练范式,使静态多模态模型具备在真实网络环境中进行多轮工具调用(如文本/图像搜索、网页浏览)的能力。此外,文章提出了专用的多模态搜索基准 MM-SearchExam。实验表明,VSearcher 在多模态网络搜索任务上表现优异,超越了近期同类智能体及部分专有模型。
AI 推荐理由
论文核心在于通过强化学习训练多模态 Agent 掌握搜索、浏览等工具使用技能,属于典型的技能学习研究。
研究机构
清华大学
论文信息