摘要
针对现有文本生成图像模型在复杂场景中组合多个对象及保持属性方面的不足,本文提出 coDrawAgents,一个包含解释者、规划者、检查者和绘制者的交互式多智能体对话框架。该框架通过自适应选择生成路径,利用分治策略增量规划对象布局,并引入显式纠错机制验证空间一致性与属性对齐。实验表明,该方法显著提升了文本 - 图像对齐度、空间准确性及属性绑定能力。
AI 推荐理由
论文核心提出多智能体协作框架,重点在于任务分解、布局规划及基于视觉上下文的增量规划策略。
研究机构
岭南大学
CMU
CUHK
阿里巴巴达摩院
香港科技大学
论文信息