Multimodal Reasoning Hallucination Benchmark Evaluation Medical AI
摘要

多模态 AI 系统在各类任务中表现卓越,但其视觉 - 语言推理机制尚不明确。本文报告三项发现:首先,前沿模型能为未提供的图像生成详细描述及包含病理偏见的临床结论,称为“海市蜃楼推理”;其次,无图像输入时模型在多项基准测试中仍获高分,甚至在某胸部 X 光问答基准中排名第一;最后,明确指示模型猜测而非隐含假设图像存在时,性能显著下降。这些发现暴露了视觉语言模型推理与评估的根本漏洞,亟需消除文本线索的私有基准。为此,我们提出 B-Clean 方案以实现公平、基于视觉的多模态评估。

AI 推荐理由

论文核心揭示多模态模型在无图时的幻觉推理机制,直接挑战视觉语言推理的本质。

研究机构
斯坦福大学电气工程系,美国加州斯坦福 斯坦福大学医学系心脏病学部,美国加州斯坦福 斯坦福大学生物数据科学系,美国加州斯坦福 斯坦福大学计算机科学系,美国加州斯坦福 斯坦福大学生物系,美国加州斯坦福 斯坦福大学精神病学与行为科学系,美国加州斯坦福
论文信息
作者 Mohammad Asadi, Jack W. O'Sullivan, Fang Cao, Tahoura Nedaee, Kamyar Fardi et al.
发布日期 2026-03-23
arXiv ID 2603.21687
相关性评分 9/10 (高度相关)