摘要
近期大语言模型进展推动了多模态推理发展,但现有方法多孤立编码图文对,忽视现实数据的关联结构。为此,本文提出在多模态图上进行推理,其中节点含图文属性,边提供结构线索。针对跨模态一致性弱及异构模态偏好两大挑战,作者提出 Mario 框架。该框架包含两阶段:一是基于图条件的视觉语言模型设计,利用图拓扑引导细粒度对比学习;二是模态自适应图指令微调机制,通过可学习路由器为每个节点动态选择最优模态配置。实验表明,Mario 在节点分类和链接预测任务上均优于最先进模型。
AI 推荐理由
论文核心提出基于图的多模态推理框架,解决跨模态一致性与偏好问题,属推理能力核心研究。
研究机构
上海纽约大学
清华大学
论文信息