Multimodal Reasoning Self-Play Reinforcement Learning Vision-Language Models
摘要

强化学习虽能提升视觉语言模型(VLM)的推理能力,但依赖昂贵标注且难以扩展。现有无监督方法易因视觉 grounding 弱而偏离。本文提出 DUEL,一种自进化后训练框架,通过同一预训练 VLM 初始化的两个策略间的对抗交互产生监督信号。挑战者生成基于图像的真实陈述及微扰硬负样本,求解者进行验证,以促进细粒度视觉判别。此外,引入长度归一化对数似然奖励以稳定优化。实验表明,DUEL 无需额外人工标注或外部工具,即可持续提升视觉推理与鲁棒判别能力。

AI 推荐理由

论文核心提出对抗自博弈框架,旨在显著提升多模态模型的推理与判别能力。

研究机构
Meta AI
论文信息
作者 Lin Qiu, Hanqing Zeng, Yao Liu, Bingjun Sun, Guangdeng Liao et al.
发布日期 2026-05-24
arXiv ID 2605.24794
相关性评分 9/10 (高度相关)