VideoQA Multi-Agent Storyline Reasoning Cross-Modal
摘要

视频问答(VideoQA)需整合时空与语义信息以捕捉视频动态。现有方法多依赖定位关键帧,缺乏人类般基于演变故事线的推理能力。为此,本文提出 SVAgent,一种故事线引导的跨模态多智能体框架。其中,故事线智能体结合优化建议智能体对历史失败的分析,逐步构建叙事表征;跨模态决策智能体在故事线引导下独立预测答案;元智能体则评估并对齐多模态输出,增强推理鲁棒性与一致性。实验表明,该方法通过模拟人类故事线推理,显著提升了性能与可解释性。

AI 推荐理由

论文核心在于模拟人类通过连贯故事情节进行推理的能力,利用多智能体协作提升视频问答的推理鲁棒性。

研究机构
BCML, Heriot-Watt University Nanyang Technological University Peking University
论文信息
作者 Zhongyu Yang, Zuhao Yang, Shuo Zhan, Tan Yue, Wei Pang et al.
发布日期 2026-04-06
arXiv ID 2604.05079
相关性评分 9/10 (高度相关)