Multimodal LLM Reinforcement Learning Visual Reasoning GRPO
摘要

组相对策略优化(GRPO)虽推动了多模态大语言模型的发展,但在开源通用模型中仍受限于奖励拓扑差异大及细粒度感知与多步推理难以平衡的挑战。本文提出高斯 GRPO(G²RPO),通过非线性分布匹配强制优势分布收敛至标准正态分布,确保梯度公平性并提升训练稳定性。在此基础上,引入响应长度塑造和熵塑造两种机制,动态平衡复杂查询的推理链生成与视觉定位。实验表明,OpenVLThinkerV2 在 18 个基准测试中表现优异,超越现有开源及专有前沿模型。

AI 推荐理由

论文核心提出多模态推理模型,通过新 RL 目标平衡感知与多步推理能力。

研究机构
University of California, Los Angeles (UCLA)
论文信息
作者 Wenbo Hu, Xin Chen, Yan Gao-Tian, Yihe Deng, Nanyun Peng et al.
发布日期 2026-04-09
arXiv ID 2604.08539
相关性评分 9/10 (高度相关)