摘要
视频混剪创作需跨语义、视觉及听觉维度进行复杂协调。针对现有自动化框架忽视跨层级多模态协同导致序列割裂的问题,本文将其建模为多模态一致性满足问题,并提出 DIRECT 框架。该框架模拟专业制作流程,采用分层多智能体架构,将任务分解为三个级联层级:编剧负责全局结构锚定,导演实例化自适应编辑意图,编辑执行细粒度优化。实验表明,该方法在客观指标与主观评价上均显著优于最先进基线。
AI 推荐理由
论文提出分层多智能体规划框架,核心在于任务分解与多级协同规划。
研究机构
北京大学电子工程与计算机科学学院
论文信息