摘要
本文提出了一种名为 A4VL 的多智能体感知 - 行动探索联盟,旨在实现高效的长视频推理。该系统通过多轮感知与行动探索循环运作:在感知阶段,智能体提取特定查询线索并定位相关视频片段;在行动阶段,智能体生成初始答案,通过交叉评审与相关性排序进行协作评分,并根据共识情况决定是剪枝重组开启新一轮推演,还是输出最终结论。实验表明,A4VL 在五个主流视频问答基准上优于现有方法,同时显著降低了推理延迟。
AI 推荐理由
论文核心解决长视频推理问题,提出多智能体感知 - 行动联盟机制,显著提升推理效率与质量。
研究机构
佐治亚理工学院,美国
思科系统公司,美国
论文信息