摘要
本文提出 THEMIS,一个新颖的多任务基准,旨在全面评估多模态大语言模型(MLLMs)在真实学术场景中的视觉欺诈推理能力。该基准包含源自真实撤稿案例及精心构建的合成数据的四千余个问题,涵盖七种场景与五类欺诈类型。通过建立欺诈类型与核心视觉推理能力的映射,THEMIS 实现了多维度的能力评估。实验表明,即便是表现最佳的模型准确率也仅过半,证明了该基准的严格性与挑战性,有望推动复杂现实任务中 MLLM 的发展。
AI 推荐理由
论文核心在于评估 MLLM 在复杂学术造假场景下的视觉欺诈推理能力,属于推理能力的深度研究。
研究机构
北京邮电大学网络空间安全学院
论文信息