摘要
尽管大型多模态模型(LMMs)在视频理解上表现优异,但其因果发现易受文本先验捷径影响。本文提出 ProCauEval 评估协议,通过扰动视觉和文本模态诊断机制缺陷。研究发现模型虽能感知视频内容,却在因果推理中未能充分利用。为此,提出基于负教师对齐的反蒸馏策略优化(ADPO),强制模型依赖视觉证据而非文本捷径。实验表明,该方法在不牺牲基础理解的前提下提升了视觉参与度,迈向可靠的因果发现。
AI 推荐理由
论文核心研究多模态模型在因果发现中的推理缺陷及增强视觉证据 grounding 的方法。
研究机构
Harbin Institute of Technology
Pengcheng Laboratory
National University of Singapore
Peking University
Harvard University
论文信息