Vision-Language Models Deepfake Detection Temporal Reasoning Benchmark
摘要

当前用于深度伪造检测的视觉语言模型(VLM)擅长识别空间伪影,却忽视了视频伪造中关键的时间不一致性。为填补这一空白,本文提出了法医问答(FAQ)基准,将时间性深度伪造分析构建为多项选择任务。该基准包含面部感知、时间伪造定位和法医推理三个层级,旨在逐步评估并赋予 VLM 法医能力。实验表明,基于 FAQ 指令微调的模型在域内及跨数据集检测中均表现优异,证实了 FAQ 是提升 VLM 时间推理能力的关键驱动力。

AI 推荐理由

论文核心在于评估和提升 VLM 对视频伪造的时间维度推理能力,构建专门基准。

研究机构
中国信息通信研究院 北京大学
论文信息
作者 Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li et al.
发布日期 2026-02-25
arXiv ID 2602.21779
相关性评分 9/10 (高度相关)