医疗 AI 幻觉检测 视觉语言模型 推理评估
摘要

大型视觉 - 语言模型(VLM)在医疗图像理解中表现优异,但常生成看似合理却错误的陈述,引发安全隐患。现有基准多关注二维图像的单次诊断,难以揭示定位与异常识别中的推理错误。本文推出 Med-StepBench,首个针对 3D 肿瘤 PET/CT 的大规模逐步幻觉检测基准,包含超 1.2 万张图像及百万级图像 - 陈述对,将临床推理分解为四个专家设计的阶段。评估揭示了聚合指标掩盖的系统性失败模式,并发现当前 VLM 易受对抗性中间解释影响,显著放大幻觉。

AI 推荐理由

论文提出分层推理框架,核心在于评估多步临床推理中的幻觉与逻辑 grounding。

研究机构
SAOMAR, Télécom SudParis, Institut Polytechnique de Paris, France
论文信息
作者 Minh Khoi Nguyen, Dai Lam Le, Amir Reza Jafari, Tuan Dung Nguyen, Mai Hong Son et al.
发布日期 2026-05-11
arXiv ID 2605.10002
相关性评分 9/10 (高度相关)