摘要
当前用于深度伪造检测的视觉语言模型(VLM)擅长识别空间伪影,却忽视了视频伪造中关键的时间不一致性。为填补这一空白,本文提出了法医问答(FAQ)基准,将时间性深度伪造分析构建为多项选择任务。该基准包含面部感知、时间伪造定位和法医推理三个层级,旨在逐步评估并赋予 VLM 法医能力。实验表明,基于 FAQ 指令微调的模型在域内及跨数据集检测中均表现优异,证实了 FAQ 是提升 VLM 时间推理能力的关键驱动力。
AI 推荐理由
论文核心在于评估和提升 VLM 对视频伪造的时间维度推理能力,构建专门基准。
研究机构
中国信息通信研究院
北京大学
论文信息