Medical VQA Chain-of-Thought Knowledge Distillation Parameter-Efficient Fine-Tuning
摘要

大型与紧凑视觉语言模型(VLM)间的推理差距限制了医疗 AI 在便携设备上的部署。现有知识蒸馏方法仅传递答案而缺失推理过程。本文提出 LiteMedCoT-VL,通过基于 LoRA 的微调,将 235B 教师模型的思维链推理能力蒸馏至 2B 学生模型。该方法在无图像字幕的临床场景下,于 PMC-VQA 基准上达到 64.9% 准确率,显著优于基线。结果表明,具备推理蒸馏的小模型可超越参数量加倍的模型,且依赖真实的视觉内容而非文本先验。

AI 推荐理由

论文核心在于通过思维链蒸馏提升紧凑模型的医疗多步推理能力,直接解决推理差距问题。

研究机构
School of Information Technology, Monash University Malaysia Faculty of Innovation Engineering, Macau University of Science and Technology Department of Bioelectronics
论文信息
作者 Runze Ma, Shunbo Jia, Haonan Lyu, Guo Liu, Caizhi Liao
发布日期 2026-05-10
arXiv ID 2605.09384
相关性评分 9/10 (高度相关)