摘要
本文提出 GlobalDentBench,首个涵盖 88 个国家、14 个牙科专科的多国牙科基准。该基准包含 8978 个经专家验证的问题,评估知识回忆、常规推理及个性化推理三个层级。对 12 个前沿大模型的评估显示,随推理复杂度增加,性能显著下降;案例分析中不安全建议率高达 31%。研究揭示了当前模型在医疗推理与安全性的根本局限,为可信临床 AI 评估提供了可扩展基础。
AI 推荐理由
论文核心评估 LLM 在牙科领域的临床推理能力,构建分层推理基准并分析性能退化。
研究机构
Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong
论文信息