Reinforcement Learning Personalized Reasoning Multimodal Models Understanding-Generation Synergy
摘要

统一多模态模型在通用任务中表现优异,但在桥接个性化理解与生成方面存在不足。现有工作多依赖隐式令牌级对齐,未能充分捕捉理解与创造的协同潜力。本文提出 Sync-R1,一种端到端强化学习框架,在单一显式推理循环中联合优化个性化理解与生成。该框架通过统一反馈过程,使个性化理解指导内容创作,而生成质量反过来完善理解。此外,引入 Sync-GRPO 方法及动态组缩放技术以加速收敛,并构建了包含更丰富上下文的 UnifyBench++ 基准。实验表明该方法在跨任务推理和个性化方面达到最先进水平。

AI 推荐理由

论文提出端到端强化学习框架,核心在于优化显式推理循环中的个性化理解与生成协同。

研究机构
北京大学 南京大学 CUHK 中国科学院
论文信息
作者 Zijun Shen, Sihan Yang, Ruichuan An, Ziyu Guo, Hao Liang et al.
发布日期 2026-05-11
arXiv ID 2605.10445
相关性评分 9/10 (高度相关)