摘要
基于可验证奖励的强化学习(RLVR)在增强多模态大语言模型(MLLM)推理能力方面潜力巨大,但其依赖语言先验及昂贵的人工标注限制了视觉理解与可扩展性。本文提出 SSL-R1,一种通用的自监督强化学习框架,直接从图像中推导可验证奖励。通过将自监督学习任务重构为可验证的视觉谜题,该方法无需人工或外部模型监督即可进行后训练。实验表明,该框架显著提升了 MLLM 在多模态理解与推理基准上的表现,证明了利用视觉中心自监督任务进行大规模强化学习的可行性。
AI 推荐理由
论文核心在于通过自监督视觉强化学习提升多模态大模型的推理能力,直接针对推理基准优化。
研究机构
Max Planck Institute for Informatics, SIC
VIA Research Center
Google
论文信息