摘要
基于知识的视觉问答(KB-VQA)要求模型结合外部知识回答图像问题,因检索噪声及知识库的结构性特征而极具挑战。本文提出 Wiki-R1,一种基于数据生成的课程强化学习框架,旨在系统性地激励多模态大语言模型(MLLMs)的推理能力。该方法构建了与模型能力演进对齐的训练分布序列,弥合了预训练与目标分布间的差距。通过引入可控课程数据生成及课程采样策略,有效引导模型学习。实验表明,Wiki-R1 在 Encyclopedic VQA 和 InfoSeek 基准上均取得了新的最先进结果。
AI 推荐理由
论文核心在于通过课程强化学习激励多模态大模型的推理能力,解决知识型 VQA 中的推理难题。
研究机构
上海交通大学
上海工程技术大学智能视觉与成像研究中心
凌光实验室
论文信息