摘要
针对现有方法依赖昂贵监督或强化学习的问题,本文提出一种无需训练的范式,通过跨模态模型融合赋予视觉语言模型(VLM)自主搜索能力。该方法将文本搜索 Agent 与基础 VLM 融合,无需额外多模态数据即可组合出搜索技能。为缓解参数干扰,提出了基于显著性的最优大脑融合(OBM)算法。实验表明,该策略既保证了零样本性能底线,又作为热启动策略显著提升了收敛速度与准确率上限。
AI 推荐理由
论文核心在于赋予 VLM 自主调用搜索工具的技能,提出无训练范式解决冷启动问题。
研究机构
Apt Group, Hangzhou, China
Peking University, Beijing, China
论文信息