摘要
本文针对现有代理框架在长视频生成这一长程多模态任务中的不足,提出了 VideoWeaver 基准与 harness。该框架允许代理将基础技能组合成自定义工作流,而非遵循预设管道。我们设计了“代理即裁判”机制,基于执行轨迹和最终视频提供证据驱动的反馈。利用此反馈,本文进一步提出了一种技能进化算法,用于优化和合并代理技能。实验表明,显式的组合技能及随后的技能进化显著提升了生成质量,且评估结果与人类判断高度一致。
AI 推荐理由
论文核心提出技能进化算法,通过反馈 refine 和 merge 技能,实现 Agent 自我改进。
研究机构
浙江大学
ByteDance
论文信息