Medical AI Reinforcement Learning Visual Reasoning Agentic VLM
摘要

针对现有视觉语言模型在全景牙科 X 光片分析中缺乏细粒度空间推理与多步验证能力的问题,本文提出 OralGPT-Plus。这是一种代理式视觉语言模型,旨在执行迭代且具备对称感知能力的诊断推理。研究构建了包含专家 curated 诊断轨迹的 DentalProbe 数据集,并提供结构化监督以支持局部检查与对侧比较。此外,开发了基于重检驱动的强化学习框架,利用基于规则的奖励和条件诊断驱动奖励,鼓励具有临床意义的复查并稳定长程推理。同时,推出了首个全景诊断基准 MMOral-X。实验表明,该方法在多个基准上显著优于强基线,证明了交互式与对称感知推理的有效性。

AI 推荐理由

论文核心在于通过强化学习实现迭代式、对称感知的细粒度空间推理与多步诊断验证。

研究机构
香港大学 香港大学牙医学院 北京大学计算机学院 上海交通大学 中国科学院自动化研究所 香港科技大学 香港科技大学(GZ)
论文信息
作者 Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao et al.
发布日期 2026-03-06
arXiv ID 2603.06366
相关性评分 9/10 (高度相关)