VLM Ensemble Visual Reasoning Model Fusion Hallucination Mitigation
摘要

针对现有视觉语言模型(VLM)集成研究多局限于语言模态的问题,本文提出利用视觉与语言双模态进行多样化模型选择。通过引入焦点误差多样性及基于 CKA 的焦点多样性指标,量化模型间视觉嵌入的差异,并利用遗传算法剪枝无效组件。该方法能动态捕捉认知不确定性并抑制幻觉,即使在缺乏多数共识或多数模型出错时,仍能生成高性能的融合预测。在多个基准测试中,该方法显著优于单一最佳模型及当前顶尖 VLM。

AI 推荐理由

论文核心在于通过多模型融合与多样性度量提升视觉语言推理能力,直接解决推理准确性问题。

研究机构
佐治亚理工学院 思科系统公司
论文信息
作者 Selim Furkan Tekin, Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Margaret L. Loper et al.
发布日期 2026-03-13
arXiv ID 2603.12669
相关性评分 9/10 (高度相关)