Medical Benchmark Clinical Reasoning Safety Evaluation Dentistry
摘要

本文提出 GlobalDentBench,首个涵盖 88 个国家、14 个牙科专科的多国牙科基准。该基准包含 8978 个经专家验证的问题,评估知识回忆、常规推理及个性化推理三个层级。对 12 个前沿大模型的评估显示,随推理复杂度增加,性能显著下降;案例分析中不安全建议率高达 31%。研究揭示了当前模型在医疗推理与安全性的根本局限,为可信临床 AI 评估提供了可扩展基础。

AI 推荐理由

论文核心评估 LLM 在牙科领域的临床推理能力,构建分层推理基准并分析性能退化。

研究机构
Division of Applied Oral Sciences and Community Dental Care, Faculty of Dentistry, The University of Hong Kong
论文信息
作者 Junjie Zhao, Jingyi Liang, Zhenyang Cai, Jiaming Zhang, Zhenwei Wen et al.
发布日期 2026-05-23
arXiv ID 2605.24636
相关性评分 9/10 (高度相关)