摘要
眼底图像理解因知识密集性而极具挑战,现有方法依赖非公开的高质量临床报告数据。为突破此限制,本文提出 Fundus-R1,仅利用公共数据集(94% 仅为图像级标签)训练推理增强的眼底阅读多模态大语言模型。主要贡献包括:一是提出基于检索增强生成(RAG)的方法,自动构建连接视觉发现与眼科知识的图像特异性推理轨迹;二是在可验证奖励的强化学习(RLVR)中引入过程奖励,鼓励推理轨迹的自我一致性。实验表明,该模型在多个基准测试中显著优于基线模型,证明了利用公共数据训练高性能眼底阅读模型的可行性。
AI 推荐理由
论文核心提出知识感知推理轨迹生成及过程奖励机制,显著提升模型推理能力。
研究机构
Renmin University of China
The Hong Kong University of Science and Technology
Zhejiang Gongshang University
论文信息