摘要
重症监护室(ICU)产生漫长且动态的临床信息流,亟需可靠的 AI 决策支持。现有基准常将医生历史行为视为真值,但这可能因信息不全而非最优,难以评估 AI 的真实推理能力。本文提出 RealICU,这是一个基于事后标注的基准,由资深医师回顾完整病程后生成标签,包含患者状态评估等四项任务。实验表明,现有模型(含记忆增强型)表现不佳,存在回忆与安全的权衡及早期的锚定偏差。此外,本文引入 ICU-Evo 研究结构化记忆智能体,虽提升了长程推理但未完全消除安全隐患。
AI 推荐理由
论文核心评估 LLM 在长上下文 ICU 数据中的真实推理能力,揭示锚定偏差等推理失败模式。
研究机构
Technical University of Munich (TUM)
University of Oxford
LMU Munich
University of Sheffield
Sun Yat-sen University Cancer Center
Imperial College London
论文信息