摘要
针对视觉语言模型在牙科全景片(OPG)特定任务中表现不足的问题,本文提出 OPGAgent,一种多工具协同的可审计解读系统。该系统包含三个核心组件:通过动态调用工具将分析分解为全局、象限及牙齿层级的分层证据收集模块;封装空间、检测等能力的专用工具箱;以及基于解剖约束解决冲突的共识子智能体。此外,文章构建了基于临床报告三元组的 OPG-Bench 基准。实验表明,OPGAgent 在结构化报告和 VQA 评估中均优于现有模型。
AI 推荐理由
论文核心提出分层证据收集模块,动态分解任务并规划工具调用,属于典型的任务规划研究。
研究机构
莫纳什大学信息科技学院健康实验室,墨尔本,澳大利亚
香港大学牙科学院,香港
论文信息