摘要
近期视频编辑模型虽采用统一条件设计,但依赖用户提供完备的文本与视觉指引,难以应对现实中的模糊请求。本文提出 Aurora,一个结合工具增强型视觉语言模型(VLM)代理与统一视频扩散变换器的代理框架。该 VLM 代理能将原始用户请求映射为符合模型条件通道的结构化编辑计划,在生成前解决文本与视觉的不确定性。通过监督学习与偏好对训练,Aurora 在多个基准测试中显著优于仅指令基线,并展现出良好的迁移能力。
AI 推荐理由
论文核心在于利用 Agent 将模糊用户请求转化为结构化编辑计划,解决规划问题。
研究机构
UofR
论文信息