摘要
大型与紧凑视觉语言模型(VLM)间的推理差距限制了医疗 AI 在便携设备上的部署。现有知识蒸馏方法仅传递答案而缺失推理过程。本文提出 LiteMedCoT-VL,通过基于 LoRA 的微调,将 235B 教师模型的思维链推理能力蒸馏至 2B 学生模型。该方法在无图像字幕的临床场景下,于 PMC-VQA 基准上达到 64.9% 准确率,显著优于基线。结果表明,具备推理蒸馏的小模型可超越参数量加倍的模型,且依赖真实的视觉内容而非文本先验。
AI 推荐理由
论文核心在于通过思维链蒸馏提升紧凑模型的医疗多步推理能力,直接解决推理差距问题。
研究机构
School of Information Technology, Monash University Malaysia
Faculty of Innovation Engineering, Macau University of Science and Technology
Department of Bioelectronics
论文信息