摘要
尽管多模态大语言模型(MLLM)在心电图自动解读中表现 promising,但其是否真正执行逐步推理仍不明确。为此,本文提出 ECG-Reasoning-Benchmark,这是一个包含超 6400 个样本的多轮评估框架,旨在系统评估 17 种核心心电图诊断的逐步推理能力。对最先进模型的评估显示,其在执行多步逻辑推导方面存在严重缺陷:虽具备检索临床标准的知识,但维持完整推理链的成功率极低(仅 6%),主要失败于无法将心电图发现与实际视觉证据对应。结果表明当前 MLLM 绕过了真正的视觉解读,暴露了现有训练范式的缺陷,强调了构建以推理为中心的医疗 AI 的必要性。
AI 推荐理由
论文核心评估 MLLM 在心电图解读中的逐步逻辑推理能力,揭示其推理链断裂问题。
研究机构
延世大学医学院
KAIST-延世大学医学院联合研究所
论文信息