摘要
长篇幅视觉叙事需在镜头间保持连续性,包括角色一致、环境稳定及场景过渡平滑。现有生成模型虽能产出高质量单帧,却难以维持此类连续性。本文提出 CANVAS,一种通过视觉智能体分镜显式规划多镜头叙事连续性的多智能体框架。该框架通过角色连续性、持久背景锚点及位置感知场景规划,确保同一设定内的平滑过渡。在两个分镜生成基准测试及新提出的高难度长程一致性基准中,CANVAS 显著优于现有最佳基线。
AI 推荐理由
论文提出多智能体框架,显式规划视觉连续性,核心在于场景与叙事的任务规划。
研究机构
University of Maryland, College Park
Google
论文信息