摘要
长视频理解因视觉冗余密集、长程时间依赖及现有代理易产生语义漂移而极具挑战。本文主张推理应始于深思熟虑的任务构建,而非被动检索,提出“先思后找”原则。据此设计了 VideoHV-Agent 框架,将视频问答重构为结构化假设验证过程:Thinker 基于摘要将候选答案转化为可测假设,Judge 推导判别性线索,Verifier 利用细粒度内容验证线索,Answer 代理整合证据生成最终答案。实验表明该方法在三个基准上达到最先进水平,兼具高可解释性与低计算成本。
AI 推荐理由
提出假设验证框架,核心解决长视频推理中的语义漂移与逻辑错误问题。
研究机构
浙江大学计算机科学与技术学院,中国
加州大学伯克利分校,美国
论文信息