Vision-Language Models Model Merging Skill Injection Cross-Modal Learning
摘要

视觉语言模型(VLM)在通用多模态理解上表现优异,但难以高效获取不断演化的领域特定技能。传统微调方法成本高,而模型合并可作为高效替代方案,将大语言模型的领域专长转移至 VLM。本文系统研究了跨模态技能注入的场景、方法及超参数。研究发现该方法在指令遵循和跨语言场景中表现良好,但在数学推理上较弱;经典合并方法(如 TA 和 DARE)性能优越,且其表现高度依赖超参数调优。

AI 推荐理由

论文核心研究跨模态技能注入,旨在让 VLM 高效获取领域特定技能,属于技能学习范畴。

研究机构
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University WeChat AI, Tencent Inc., China The University of Hong Kong
论文信息
作者 Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou et al.
发布日期 2026-05-19
arXiv ID 2605.19523
相关性评分 9/10 (高度相关)