摘要
针对现有视觉语言模型(VLM)集成研究多局限于语言模态的问题,本文提出利用视觉与语言双模态进行多样化模型选择。通过引入焦点误差多样性及基于 CKA 的焦点多样性指标,量化模型间视觉嵌入的差异,并利用遗传算法剪枝无效组件。该方法能动态捕捉认知不确定性并抑制幻觉,即使在缺乏多数共识或多数模型出错时,仍能生成高性能的融合预测。在多个基准测试中,该方法显著优于单一最佳模型及当前顶尖 VLM。
AI 推荐理由
论文核心在于通过多模型融合与多样性度量提升视觉语言推理能力,直接解决推理准确性问题。
研究机构
佐治亚理工学院
思科系统公司
论文信息