摘要
视觉语言模型(VLM)在通用多模态理解上表现优异,但难以高效获取不断演化的领域特定技能。传统微调方法成本高,而模型合并可作为高效替代方案,将大语言模型的领域专长转移至 VLM。本文系统研究了跨模态技能注入的场景、方法及超参数。研究发现该方法在指令遵循和跨语言场景中表现良好,但在数学推理上较弱;经典合并方法(如 TA 和 DARE)性能优越,且其表现高度依赖超参数调优。
AI 推荐理由
论文核心研究跨模态技能注入,旨在让 VLM 高效获取领域特定技能,属于技能学习范畴。
研究机构
State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University
WeChat AI, Tencent Inc., China
The University of Hong Kong
论文信息