摘要
针对现有基于多模态大模型(MLLM)的深度伪造检测方法缺乏专业伪造知识及批判性推理能力的问题,本文提出 VRAG-DFD 框架。该框架结合检索增强生成(RAG)与强化学习(RL),旨在为 MLLM 提供高质量动态伪造知识并增强其在噪声参考信息下的批判性推理能力。具体而言,构建了法医知识库与法医思维链数据集,并采用三阶段训练策略逐步培养模型能力。实验表明,该方法在泛化测试中取得了最先进的性能。
AI 推荐理由
论文核心在于利用 RAG 和 RL 赋予 MLLM 针对噪声信息的批判性推理能力,构建思维链数据集。
研究机构
上海交通大学
腾讯优图实验室
论文信息