摘要
针对统一多模态模型中存在的“理解 - 生成鸿沟”,本文提出一种新框架,使模型能根据指令复杂度自主切换生成策略。通过构建包含直接生成、自我反思及多步规划三种自适应模式的层级数据流水线,解决注意力纠缠与视觉 refinement 瓶颈。研究构建了超 5 万样本数据集,采用 SFT 与 RL 两阶段训练,设计逐步推理奖励以确保逻辑一致性。实验表明,该方法在各类 X2I 任务中显著优于基线,实现了高保真度的图像生成。
AI 推荐理由
论文核心提出多步规划模式分解复杂场景,并设计逐步推理奖励,属规划机制研究。
研究机构
Shanghai Jiao Tong University
论文信息