摘要
尽管多模态大语言模型(MLLM)进展显著,但其在多模态诊断中的临床推理能力尚未得到充分考察。现有基准多基于单模态数据,无法评估临床实践至关重要的渐进式推理与跨模态整合能力。本文提出跨模态渐进式临床推理(X-PCR)基准,这是首个通过完整眼科诊断工作流程全面评估 MLLM 的基准。该基准包含两项推理任务:一是涵盖从图像质量评估到临床决策的六阶段渐进式推理链;二是整合六种成像模态的跨模态推理任务。数据集包含来自 51 个公共数据集的 26,415 张图像和 177,868 个专家验证的视觉问答对,覆盖 52 种眼科疾病。对 21 个 MLLM 的评估揭示了其在渐进式推理和跨模态整合方面的关键差距。
AI 推荐理由
论文核心构建跨模态渐进式临床推理基准,直接评估 MLLM 的推理链条与整合能力。
研究机构
深圳大学计算机科学与软件工程学院
诺丁汉大学
温州医科大学
广东省智能信息处理重点实验室,深圳大学
论文信息