VideoQA Counterfactual Reasoning Causal Inference Evidence Disentanglement
摘要

近期视频多模态模型虽提升了视频问答性能,但常依赖虚假统计相关性而非因果证据,导致推理不可靠。现有方法多在时间区间层面操作,难以显式分离因果视觉线索与混淆因子。为此,本文提出 CREDiT 框架,利用结构因果模型将跨模态表示分解为因果与非因果成分,并引入特征级因果干预构建反事实输入,以抑制非因果关联。实验表明,该方法在多个数据集上显著提高了答案准确性与推理可靠性。

AI 推荐理由

论文提出反事实推理框架,核心解决视频问答中的因果推理与证据解耦问题。

研究机构
南京大学 日本国立大学 美国北卡罗来纳州立大学 中国清华大学
论文信息
作者 Zhou Du, Hamid Krim, Xiao Wu, Zhaoquan Yuan, Liangwei Li et al.
发布日期 2026-06-08
arXiv ID 2606.09181
相关性评分 9/10 (高度相关)