Long Video Understanding Multi-Agent System Hypothesis Verification Logical Reasoning
摘要

长视频理解因视觉冗余密集、长程时间依赖及现有代理易产生语义漂移而极具挑战。本文主张推理应始于深思熟虑的任务构建,而非被动检索,提出“先思后找”原则。据此设计了 VideoHV-Agent 框架,将视频问答重构为结构化假设验证过程:Thinker 基于摘要将候选答案转化为可测假设,Judge 推导判别性线索,Verifier 利用细粒度内容验证线索,Answer 代理整合证据生成最终答案。实验表明该方法在三个基准上达到最先进水平,兼具高可解释性与低计算成本。

AI 推荐理由

提出假设验证框架,核心解决长视频推理中的语义漂移与逻辑错误问题。

研究机构
浙江大学计算机科学与技术学院,中国 加州大学伯克利分校,美国
论文信息
作者 Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian et al.
发布日期 2026-03-05
arXiv ID 2603.04977
相关性评分 9/10 (高度相关)