摘要
针对数据驱动型演示文稿更新耗时的问题,现有方法难以支持多样化的用户自定义模板。本文定义了“基于自然语言指令的用户模板动态幻灯片更新”任务,并推出包含两万余条真实指令执行三元组的大规模基准 DynaSlide。为此,作者提出了 SlideAgent 框架,该智能体结合多模态幻灯片解析、自然语言指令落地及增强工具推理能力,能在保留布局风格的同时更新图表与文本内容。此外,研究还设计了端到端及组件级评估协议,揭示了该领域的关键挑战与机遇。
AI 推荐理由
论文核心提出 SlideAgent,重点在于智能体如何利用工具进行多模态解析与推理以执行更新任务。
研究机构
School of Artificial Intelligence, Beijing Normal University, Beijing, PR China
Institute of Artificial Intelligence and Future Networks, Beijing Normal University, Zhuhai, PR China
Faculty of Arts and Sciences, Beijing Normal University, Zhuhai, PR China
Beijing Normal-Hong Kong Baptist University, Zhuhai, PR China
论文信息