摘要
本文提出 AlphaGRPO 框架,将群组相对策略优化应用于自回归扩散统一多模态模型,无需冷启动即可增强多模态生成能力。该方法激发了模型的高级推理潜能,包括推断隐含用户意图的推理文本到图像生成,以及自主诊断并纠正输出偏差的自反思 refinement。为解决真实场景监督难题,引入了分解式可验证奖励,利用大语言模型将复杂请求拆解为原子化可验证问题,由多模态模型提供可靠反馈。实验表明该方法在多个基准测试中显著提升生成质量及编辑任务表现。
AI 推荐理由
论文核心在于通过自我反思和强化学习实现模型生成的自主诊断与修正,属于典型的自我进化机制。
研究机构
The University of Hong Kong
论文信息