摘要
近期研究表明,强化学习(特别是 GRPO)能内在激发并增强视觉语言模型(VLM)的推理能力。然而,其有效机制及局限性尚不明确。本文指出,RL 模型倾向于深层但狭窄的推理,而基座模型虽路径不够精炼,却展现出更广泛多样的思维模式。分析显示,GRPO 易导致多样性坍塌,使模型过早收敛于有限的推理策略子集,陷入局部最优且扩展性差。为此,我们提出多组策略优化(MUPO),旨在激励多解的发散性思维,并在基准测试中验证了其有效性。
AI 推荐理由
论文核心研究通过强化学习激发和优化视觉语言模型的推理能力,解决多样性坍塌问题。
研究机构
Australian National University
Shanghai AI Lab
GE Research
论文信息