因果推理 视觉语言模型 多图像理解 结构化令牌 因果图
摘要

视觉因果推理对于理解和干预物理世界至关重要,但现有大型视觉 - 语言模型在处理多图像输入的干预和反事实查询时表现脆弱。大多数方法仅通过文本提示注入因果知识,导致因果机制外在于模型执行。为此,本文提出 BridgeVLM,通过从多图像输入诱导因果图并将其转换为结构化因果令牌,利用注入 LLM 解码器的 RAMP 层进行因果消息传递,从而实现视觉因果推理的内化。此外,引入统一训练接口 M3S 提供细粒度因果监督。实验表明,该方法在因果推理任务上显著优于基于提示的监督方法。

AI 推荐理由

论文核心解决视觉因果推理问题,提出内部化因果机制的新架构,显著提升推理能力。

研究机构
Department of Computer & Data Sciences, Case Western University, Cleveland, Ohio, US
论文信息
作者 Haoping Yu, Yuanxi Li, Jing Ma
发布日期 2026-06-10
arXiv ID 2606.11745
相关性评分 9/10 (高度相关)