Causal Discovery Multimodal Reasoning Visual Grounding Reinforcement Learning
摘要

尽管大型多模态模型(LMMs)在视频理解上表现优异,但其因果发现易受文本先验捷径影响。本文提出 ProCauEval 评估协议,通过扰动视觉和文本模态诊断机制缺陷。研究发现模型虽能感知视频内容,却在因果推理中未能充分利用。为此,提出基于负教师对齐的反蒸馏策略优化(ADPO),强制模型依赖视觉证据而非文本捷径。实验表明,该方法在不牺牲基础理解的前提下提升了视觉参与度,迈向可靠的因果发现。

AI 推荐理由

论文核心研究多模态模型在因果发现中的推理缺陷及增强视觉证据 grounding 的方法。

研究机构
Harbin Institute of Technology Pengcheng Laboratory National University of Singapore Peking University Harvard University
论文信息
作者 Jiafeng Liang, Zhihao Zhu, Zihan Zhang, Baoqi Ren, Shixin Jiang et al.
发布日期 2026-05-10
arXiv ID 2605.09422
相关性评分 9/10 (高度相关)