摘要
文本到图像模型受限于单次生成范式,难以处理需迭代优化的复杂提示。本文形式化了“推理 - 反思 - 修正”(R^3)循环框架,并引入包含 600 多个专家标注实例的 R^3-Bench 基准。针对现有模型能识别错误但无法生成有效修正指令的问题,提出了基于组相对策略优化和分层奖励机制的 R^3-Refiner 双阶段框架。实验表明,该方法显著提升了反射性判断与修正得分,并能无缝集成至多模态大模型以增强生成质量。
AI 推荐理由
论文核心提出自我反思与修正循环,利用强化学习进化模型能力。
研究机构
Harbin Institute of Technology
Nanyang Technological University
Peking University
Shenzhen Loop Area Institute
Hong Kong Baptist University
Shanghai Jiao Tong University
University of Science and Technology of China
University of Chinese Academy of Sciences
论文信息