Medical LLM Reinforcement Learning Diagnostic Reasoning Decision Support
摘要

急性多重物质中毒需要在高度不确定性下做出快速救命决策。尽管大语言模型(LLM)具备处理异构数据的潜力,但在该场景下表现不佳。本文提出 DeToxR,首个将强化学习应用于急诊毒理学的框架。该方法基于组相对策略优化(GRPO)微调 LLM,构建鲁棒的数据融合引擎,并利用临床性能奖励直接优化模型的推理过程。通过多标签一致性指标作为奖励信号,模型能有效避免漏诊共摄入物质及幻觉。实验表明,该模型显著优于基线及专家毒理学家,展示了 RL 对齐 LLM 在高风险环境中合成非结构化叙事与结构化数据以支持决策的巨大潜力。

AI 推荐理由

论文核心在于利用强化学习优化 LLM 在复杂不确定环境下的诊断推理能力,直接针对推理机制进行改进。

研究机构
Computer Aided Medical Procedures, Technical University of Munich, Germany Munich Center for Machine Learning (MCML), Germany Department of Clinical Toxicology and Poison Control Center Munich, TUM Klinikum rechts der Isar, Germany
论文信息
作者 Nico Oberländer, David Bani-Harouni, Tobias Zellner, Nassir Navab, Florian Eyer et al.
发布日期 2026-03-31
arXiv ID 2603.29608
相关性评分 9/10 (高度相关)