Multimodal MoE Visual Reasoning Routing Mechanism
摘要

多模态混合专家(MoE)模型在视觉 - 语言任务中表现优异,但存在“视而不见思”现象:模型能准确感知图像内容,却在后续推理中失败,而相同问题的纯文本形式却能正确解决。本文证实了跨模态语义共享的存在,排除了语义对齐失败的解释,并发现视觉专家与领域专家在层级上分离,导致图像输入引发路由显著偏离。据此提出“路由干扰”假说,即视觉输入未能充分激活任务相关的推理专家。通过设计路由引导干预方法增强领域专家激活,在六个基准测试中显著提升复杂视觉推理性能。

AI 推荐理由

论文核心研究多模态 MoE 模型在视觉输入下的推理失败机制及改进方法。

研究机构
浙江大学 阿里巴巴集团
论文信息
作者 Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang et al.
发布日期 2026-04-09
arXiv ID 2604.08541
相关性评分 9/10 (高度相关)