Multimodal Reasoning Graph Neural Networks Large Language Models Instruction Tuning
摘要

近期大语言模型进展推动了多模态推理发展,但现有方法多孤立编码图文对,忽视现实数据的关联结构。为此,本文提出在多模态图上进行推理,其中节点含图文属性,边提供结构线索。针对跨模态一致性弱及异构模态偏好两大挑战,作者提出 Mario 框架。该框架包含两阶段:一是基于图条件的视觉语言模型设计,利用图拓扑引导细粒度对比学习;二是模态自适应图指令微调机制,通过可学习路由器为每个节点动态选择最优模态配置。实验表明,Mario 在节点分类和链接预测任务上均优于最先进模型。

AI 推荐理由

论文核心提出基于图的多模态推理框架,解决跨模态一致性与偏好问题,属推理能力核心研究。

研究机构
上海纽约大学 清华大学
论文信息
作者 Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan
发布日期 2026-03-05
arXiv ID 2603.05181
相关性评分 9/10 (高度相关)