摘要
大型视觉 - 语言模型(VLM)在医疗图像理解中表现优异,但常生成看似合理却错误的陈述,引发安全隐患。现有基准多关注二维图像的单次诊断,难以揭示定位与异常识别中的推理错误。本文推出 Med-StepBench,首个针对 3D 肿瘤 PET/CT 的大规模逐步幻觉检测基准,包含超 1.2 万张图像及百万级图像 - 陈述对,将临床推理分解为四个专家设计的阶段。评估揭示了聚合指标掩盖的系统性失败模式,并发现当前 VLM 易受对抗性中间解释影响,显著放大幻觉。
AI 推荐理由
论文提出分层推理框架,核心在于评估多步临床推理中的幻觉与逻辑 grounding。
研究机构
SAOMAR, Télécom SudParis, Institut Polytechnique de Paris, France
论文信息