摘要
本文提出 PresentAgent-2,一个用于从用户查询生成演示视频的代理框架。该框架首先总结查询主题并进行深度研究以收集多模态资源,随后构建幻灯片、生成特定模式的脚本,并将视听动态媒体合成为完整视频。它支持单人叙述、多角色讨论及交互式问答三种模式。研究构建了涵盖这三种场景的多模态基准,评估内容质量、媒体相关性及交互自然度,实现了从依赖文档的静态制作到基于查询的研究型视频生成的跨越。
AI 推荐理由
论文核心在于 Agent 的多步任务规划,包括研究、脚本生成及多模态内容编排。
研究机构
北京大学
La Trobe University
论文信息