Multimodal Reasoning Curriculum Learning Reinforcement Learning KB-VQA
摘要

基于知识的视觉问答(KB-VQA)要求模型结合外部知识回答图像问题,因检索噪声及知识库的结构性特征而极具挑战。本文提出 Wiki-R1,一种基于数据生成的课程强化学习框架,旨在系统性地激励多模态大语言模型(MLLMs)的推理能力。该方法构建了与模型能力演进对齐的训练分布序列,弥合了预训练与目标分布间的差距。通过引入可控课程数据生成及课程采样策略,有效引导模型学习。实验表明,Wiki-R1 在 Encyclopedic VQA 和 InfoSeek 基准上均取得了新的最先进结果。

AI 推荐理由

论文核心在于通过课程强化学习激励多模态大模型的推理能力,解决知识型 VQA 中的推理难题。

研究机构
上海交通大学 上海工程技术大学智能视觉与成像研究中心 凌光实验室
论文信息
作者 Shan Ning, Longtian Qiu, Xuming He
发布日期 2026-03-05
arXiv ID 2603.05256
相关性评分 9/10 (高度相关)