摘要
视频问答(VideoQA)需整合时空与语义信息以捕捉视频动态。现有方法多依赖定位关键帧,缺乏人类般基于演变故事线的推理能力。为此,本文提出 SVAgent,一种故事线引导的跨模态多智能体框架。其中,故事线智能体结合优化建议智能体对历史失败的分析,逐步构建叙事表征;跨模态决策智能体在故事线引导下独立预测答案;元智能体则评估并对齐多模态输出,增强推理鲁棒性与一致性。实验表明,该方法通过模拟人类故事线推理,显著提升了性能与可解释性。
AI 推荐理由
论文核心在于模拟人类通过连贯故事情节进行推理的能力,利用多智能体协作提升视频问答的推理鲁棒性。
研究机构
BCML, Heriot-Watt University
Nanyang Technological University
Peking University
论文信息