Agentic Reasoning Clinical AI Longitudinal Records Expert Consensus
摘要

本研究评估了基于大语言模型的代理推理系统在处理多发性骨髓瘤纵向临床记录时的表现。面对跨越数十年、包含数万份异构文档的复杂病史,该系统在 811 名患者的回顾性数据中与专家共识进行对比。结果显示,代理推理系统的吻合度达 79.6%,显著超越单次检索增强生成(RAG)及全上下文输入基线。其优势随问题复杂度及记录长度增加而提升,但在错误严重性上仍需改进,表明在转化为临床获益前需进一步前瞻性评估。

AI 推荐理由

论文核心评估代理推理系统在复杂临床记录中的表现,显著优于基线。

研究机构
Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital, Munich, Germany Department of Diagnostic and Interventional Radiology, Klinikum rechts der Isar, TUM University Hospital, School of Medicine and Health, Technical University of Munich, Munich, Germany
论文信息
作者 Johannes Moll, Jannik Lübberstedt, Christoph Nuernbergk, Jacob Stroh, Luisa Mertens et al.
发布日期 2026-04-27
arXiv ID 2604.24473
相关性评分 9/10 (高度相关)