摘要
本文提出 UniGRPO,一种专为交错生成设计的统一强化学习框架。该框架将多模态生成过程建模为具有稀疏终端奖励的马尔可夫决策过程,利用 GRPO 联合优化文本推理与图像合成策略。通过消除无分类器引导并采用速度场上的 MSE 惩罚替代潜在 KL 惩罚,该方法有效避免了奖励黑客问题,支持多轮交互扩展。实验表明,该统一训练方案显著提升了基于推理的图像生成质量,为全交错模型的后训练提供了稳健基准。
AI 推荐理由
论文核心提出推理驱动的图像生成框架,利用强化学习联合优化推理与生成策略。
研究机构
The Chinese University of Hong Kong
ByteDance Seed
论文信息