Model Merging Multi-modal Agent Tool Use Zero-shot Learning
摘要

针对现有方法依赖昂贵监督或强化学习的问题,本文提出一种无需训练的范式,通过跨模态模型融合赋予视觉语言模型(VLM)自主搜索能力。该方法将文本搜索 Agent 与基础 VLM 融合,无需额外多模态数据即可组合出搜索技能。为缓解参数干扰,提出了基于显著性的最优大脑融合(OBM)算法。实验表明,该策略既保证了零样本性能底线,又作为热启动策略显著提升了收敛速度与准确率上限。

AI 推荐理由

论文核心在于赋予 VLM 自主调用搜索工具的技能,提出无训练范式解决冷启动问题。

研究机构
Apt Group, Hangzhou, China Peking University, Beijing, China
论文信息
作者 Zhixiang Wang, Jingxuan Xu, Dajun Chen, Yunfang Wu, Wei Jiang et al.
发布日期 2026-03-02
arXiv ID 2603.01416
相关性评分 9/10 (高度相关)