LLM Benchmark Clinical Decision Support Long-Context Reasoning Healthcare AI
摘要

重症监护室(ICU)产生漫长且动态的临床信息流,亟需可靠的 AI 决策支持。现有基准常将医生历史行为视为真值,但这可能因信息不全而非最优,难以评估 AI 的真实推理能力。本文提出 RealICU,这是一个基于事后标注的基准,由资深医师回顾完整病程后生成标签,包含患者状态评估等四项任务。实验表明,现有模型(含记忆增强型)表现不佳,存在回忆与安全的权衡及早期的锚定偏差。此外,本文引入 ICU-Evo 研究结构化记忆智能体,虽提升了长程推理但未完全消除安全隐患。

AI 推荐理由

论文核心评估 LLM 在长上下文 ICU 数据中的真实推理能力,揭示锚定偏差等推理失败模式。

研究机构
Technical University of Munich (TUM) University of Oxford LMU Munich University of Sheffield Sun Yat-sen University Cancer Center Imperial College London
论文信息
作者 Chengzhi Shen, Weixiang Shen, Tobias Susetzky, Chen, Chen et al.
发布日期 2026-05-13
arXiv ID 2605.13542
相关性评分 9/10 (高度相关)