摘要
组合式视频检索(CoVR)旨在根据参考视频和文本修改找到目标视频。现有工作假设修改文本完全指定了视觉变化,忽略了编辑产生的隐含后果(如运动、状态转换)。本文主张成功的 CoVR 需要对此类后果进行推理,并提出一种零样本推理优先方法,利用大型多模态模型推断编辑隐含的因果与时序后果,并将推理后的查询与候选视频对齐。此外,文章提出了 CoVR-Reason 基准以评估推理能力。实验表明,该方法在召回率上优于强基线,尤其在隐含效应子集上表现卓越,证明了将推理融入通用多模态模型可有效提升视频搜索的可解释性与泛化能力。
AI 推荐理由
论文核心提出基于推理的方法,利用多模态模型推断编辑的因果和时序后果,解决视频检索难题。
研究机构
University of Wisconsin-Madison
Mohamed bin Zayed University of AI
Linköping University
论文信息