摘要
本文首次对 GPT-5 系列模型进行了控制性横断面评估,对比其在医学考试、文本推理基准及神经放射学等多模态视觉问答任务中的表现。结果显示,GPT-5 在专家级文本推理上显著提升,并能有效结合影像证据处理不确定临床叙述。尽管在细粒度病变表征上优于 GPT-4o,但在高度专业化的感知关键任务中,其表现仍不及专用系统,表明通用模型尚未能完全替代特定领域系统。
AI 推荐理由
论文核心评估 GPT-5 在多模态临床场景下的推理能力,涉及思维链与综合诊断推理。
研究机构
埃默里大学医学院放射肿瘤学系
佐治亚理工学院生物医学工程系
论文信息