摘要
针对自回归图像生成仅关注“画什么”而忽视“如何画”导致空间歧义的问题,本文提出 CoR-Painter 框架。该框架首创“如何到什么”范式,通过约束推理从输入提示中推导视觉约束(如空间关系、组合规则),以此指导详细描述的生成,确保结构合理性。此外,引入双目标 GRPO 策略优化文本推理与视觉投影过程。实验表明,该方法在空间指标上显著优于现有技术,实现了最先进的性能。
AI 推荐理由
论文提出约束推理框架,核心解决图像生成中的结构化推理问题。
研究机构
南开大学计算机学院
百度公司
论文信息