摘要
端到端漫画生成是一项结构化视觉叙事任务,涉及故事分解、角色场景定位、版面设计及分镜渲染等复杂步骤。现有模型常直接合成页面,导致控制力不足且一致性差。为此,本文提出 MangaFlow,一种可控长篇幅漫画生成的代理框架。该框架将创作过程分解为规划、定位、布局构建、参考条件渲染、构图及文字放置等阶段。通过引入“故事段落记忆”机制链接描述与视觉参考,确保了跨分镜的长期一致性,并支持用户对中间变量进行精细控制,显著提升了布局依从性与视觉连贯性。
AI 推荐理由
论文核心是将漫画生成分解为规划、布局构建等多步计划,属于典型的任务规划研究。
研究机构
The University of Tokyo
Hong Kong University of Science and Technology (Guangzhou)
论文信息