摘要
视觉语言模型在通用医疗视觉问答中表现优异,但其预测是基于证据的临床推理还是依赖虚假先验尚不明确。本文提出 Med-R2 Bench,这是一个与临床工作流对齐的分层基准,旨在评估具有视觉 grounding 的对抗鲁棒性。通过设计分步问答任务,评估四个临床阶段中推理链是否严格基于视觉证据,并利用对抗扰动测试模型对误导线索的鲁棒性。实验表明,现有模型严重依赖提示猜测答案,难以准确对齐文本描述与视觉线索。此外,利用该分层数据进行分步微调可显著提升推理鲁棒性。
AI 推荐理由
论文核心聚焦于评估和提升医疗 VLM 的证据 grounding 推理能力及对抗鲁棒性。
研究机构
Zhejiang University
Guangdong Institute of Intelligence Science and Technology
论文信息