摘要
统一多模态模型在通用任务中表现优异,但在桥接个性化理解与生成方面存在不足。现有工作多依赖隐式令牌级对齐,未能充分捕捉理解与创造的协同潜力。本文提出 Sync-R1,一种端到端强化学习框架,在单一显式推理循环中联合优化个性化理解与生成。该框架通过统一反馈过程,使个性化理解指导内容创作,而生成质量反过来完善理解。此外,引入 Sync-GRPO 方法及动态组缩放技术以加速收敛,并构建了包含更丰富上下文的 UnifyBench++ 基准。实验表明该方法在跨任务推理和个性化方面达到最先进水平。
AI 推荐理由
论文提出端到端强化学习框架,核心在于优化显式推理循环中的个性化理解与生成协同。
研究机构
北京大学
南京大学
CUHK
中国科学院
论文信息