摘要
强化学习虽能提升视觉语言模型(VLM)的推理能力,但依赖昂贵标注且难以扩展。现有无监督方法易因视觉 grounding 弱而偏离。本文提出 DUEL,一种自进化后训练框架,通过同一预训练 VLM 初始化的两个策略间的对抗交互产生监督信号。挑战者生成基于图像的真实陈述及微扰硬负样本,求解者进行验证,以促进细粒度视觉判别。此外,引入长度归一化对数似然奖励以稳定优化。实验表明,DUEL 无需额外人工标注或外部工具,即可持续提升视觉推理与鲁棒判别能力。
AI 推荐理由
论文核心提出对抗自博弈框架,旨在显著提升多模态模型的推理与判别能力。
研究机构
Meta AI
论文信息