多模态大语言模型 医疗影像分析 强化学习 推理增强 公共数据利用
摘要

眼底图像理解因知识密集性而极具挑战,现有方法依赖非公开的高质量临床报告数据。为突破此限制,本文提出 Fundus-R1,仅利用公共数据集(94% 仅为图像级标签)训练推理增强的眼底阅读多模态大语言模型。主要贡献包括:一是提出基于检索增强生成(RAG)的方法,自动构建连接视觉发现与眼科知识的图像特异性推理轨迹;二是在可验证奖励的强化学习(RLVR)中引入过程奖励,鼓励推理轨迹的自我一致性。实验表明,该模型在多个基准测试中显著优于基线模型,证明了利用公共数据训练高性能眼底阅读模型的可行性。

AI 推荐理由

论文核心提出知识感知推理轨迹生成及过程奖励机制,显著提升模型推理能力。

研究机构
Renmin University of China The Hong Kong University of Science and Technology Zhejiang Gongshang University
论文信息
作者 Yuchuan Deng, Qijie Wei, Kaiheng Qian, Jiazhen Liu, Zijie Xin et al.
发布日期 2026-04-09
arXiv ID 2604.08322
相关性评分 9/10 (高度相关)