Visual Generation Self-Reflection Reinforcement Learning Benchmark
摘要

文本到图像模型受限于单次生成范式,难以处理需迭代优化的复杂提示。本文形式化了“推理 - 反思 - 修正”(R^3)循环框架,并引入包含 600 多个专家标注实例的 R^3-Bench 基准。针对现有模型能识别错误但无法生成有效修正指令的问题,提出了基于组相对策略优化和分层奖励机制的 R^3-Refiner 双阶段框架。实验表明,该方法显著提升了反射性判断与修正得分,并能无缝集成至多模态大模型以增强生成质量。

AI 推荐理由

论文核心提出自我反思与修正循环,利用强化学习进化模型能力。

研究机构
Harbin Institute of Technology Nanyang Technological University Peking University Shenzhen Loop Area Institute Hong Kong Baptist University Shanghai Jiao Tong University University of Science and Technology of China University of Chinese Academy of Sciences
论文信息
作者 Junjie Wang, Xinghua Lou, Jason Li, Ye Tian, Keyu Chen et al.
发布日期 2026-05-19
arXiv ID 2605.19639
相关性评分 9/10 (高度相关)