Multi-Agent System Long Video Reasoning VideoQA Perception-Action Loop
摘要

本文提出了一种名为 A4VL 的多智能体感知 - 行动探索联盟,旨在实现高效的长视频推理。该系统通过多轮感知与行动探索循环运作:在感知阶段,智能体提取特定查询线索并定位相关视频片段;在行动阶段,智能体生成初始答案,通过交叉评审与相关性排序进行协作评分,并根据共识情况决定是剪枝重组开启新一轮推演,还是输出最终结论。实验表明,A4VL 在五个主流视频问答基准上优于现有方法,同时显著降低了推理延迟。

AI 推荐理由

论文核心解决长视频推理问题,提出多智能体感知 - 行动联盟机制,显著提升推理效率与质量。

研究机构
佐治亚理工学院,美国 思科系统公司,美国
论文信息
作者 Yichang Xu, Gaowen Liu, Ramana Rao Kompella, Tiansheng Huang, Sihao Hu et al.
发布日期 2026-03-14
arXiv ID 2603.14052
相关性评分 9/10 (高度相关)