Medical VLM Evidence-Grounded Reasoning Adversarial Benchmark Visual Grounding
摘要

视觉语言模型在通用医疗视觉问答中表现优异,但其预测是基于证据的临床推理还是依赖虚假先验尚不明确。本文提出 Med-R2 Bench,这是一个与临床工作流对齐的分层基准,旨在评估具有视觉 grounding 的对抗鲁棒性。通过设计分步问答任务,评估四个临床阶段中推理链是否严格基于视觉证据,并利用对抗扰动测试模型对误导线索的鲁棒性。实验表明,现有模型严重依赖提示猜测答案,难以准确对齐文本描述与视觉线索。此外,利用该分层数据进行分步微调可显著提升推理鲁棒性。

AI 推荐理由

论文核心聚焦于评估和提升医疗 VLM 的证据 grounding 推理能力及对抗鲁棒性。

研究机构
Zhejiang University Guangdong Institute of Intelligence Science and Technology
论文信息
作者 Wen Ma, Fucheng Niu, Zhiting Fan, Zikai Xiao, Jiaxiang Liu et al.
发布日期 2026-05-23
arXiv ID 2605.24492
相关性评分 9/10 (高度相关)