摘要
大型语言模型(LLM)正被探索用于临床问答与决策支持,但其安全部署亟需可靠处理异构临床笔记中的患者测量数据。现有评估多局限于算术计算,缺乏对格式鲁棒性的考察。本文提出 ClinicNumRobBench 基准,包含 1624 个实例,评估数值检索、算术计算、关系比较及聚合四类临床数感能力。通过在三种语义等价表示(含真实笔记风格)上测试 14 个模型,发现检索表现良好,但比较与聚合极具挑战。此外,医学微调可能削弱数值能力,且模型对笔记格式变化敏感。该基准为临床可靠的数值推理提供了严格测试平台。
AI 推荐理由
论文核心评估 LLM 在临床场景下的数值推理能力,涵盖检索、计算、比较与聚合,属推理研究。
研究机构
School of Computing Technologies, RMIT University, Australia
论文信息