Reinforcement Learning Vision-Language Models Divergent Thinking GRPO MUPO
摘要

近期研究表明,强化学习(特别是 GRPO)能内在激发并增强视觉语言模型(VLM)的推理能力。然而,其有效机制及局限性尚不明确。本文指出,RL 模型倾向于深层但狭窄的推理,而基座模型虽路径不够精炼,却展现出更广泛多样的思维模式。分析显示,GRPO 易导致多样性坍塌,使模型过早收敛于有限的推理策略子集,陷入局部最优且扩展性差。为此,我们提出多组策略优化(MUPO),旨在激励多解的发散性思维,并在基准测试中验证了其有效性。

AI 推荐理由

论文核心研究通过强化学习激发和优化视觉语言模型的推理能力,解决多样性坍塌问题。

研究机构
Australian National University Shanghai AI Lab GE Research
论文信息
作者 Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Peter Tu et al.
发布日期 2026-04-01
arXiv ID 2604.00479
相关性评分 9/10 (高度相关)