Multimodal Generation Self-Adaptive Planning Visual Reasoning Reinforcement Learning
摘要

针对统一多模态模型中存在的“理解 - 生成鸿沟”,本文提出一种新框架,使模型能根据指令复杂度自主切换生成策略。通过构建包含直接生成、自我反思及多步规划三种自适应模式的层级数据流水线,解决注意力纠缠与视觉 refinement 瓶颈。研究构建了超 5 万样本数据集,采用 SFT 与 RL 两阶段训练,设计逐步推理奖励以确保逻辑一致性。实验表明,该方法在各类 X2I 任务中显著优于基线,实现了高保真度的图像生成。

AI 推荐理由

论文核心提出多步规划模式分解复杂场景,并设计逐步推理奖励,属规划机制研究。

研究机构
Shanghai Jiao Tong University
论文信息
作者 Qingyang Liu, Bingjie Gao, Canmiao Fu, Zhipeng Huang, Chen Li et al.
发布日期 2026-05-14
arXiv ID 2605.14709
相关性评分 9/10 (高度相关)