摘要
近期视频多模态模型虽提升了视频问答性能,但常依赖虚假统计相关性而非因果证据,导致推理不可靠。现有方法多在时间区间层面操作,难以显式分离因果视觉线索与混淆因子。为此,本文提出 CREDiT 框架,利用结构因果模型将跨模态表示分解为因果与非因果成分,并引入特征级因果干预构建反事实输入,以抑制非因果关联。实验表明,该方法在多个数据集上显著提高了答案准确性与推理可靠性。
AI 推荐理由
论文提出反事实推理框架,核心解决视频问答中的因果推理与证据解耦问题。
研究机构
南京大学
日本国立大学
美国北卡罗来纳州立大学
中国清华大学
论文信息