摘要
针对多模态大模型处理长视频时上下文窗口受限的问题,本文提出 VideoStir 框架。现有检索增强生成(RAG)方法常将视频扁平化为独立片段,破坏时空结构且依赖显式语义匹配。VideoStir 首先构建 clip 级时空图以保留结构信息,执行多跳检索聚合远距离关联证据;其次引入基于 MLLM 的意图相关性评分器,依据查询推理意图检索帧。为此构建了 IR-600K 数据集。实验表明该方法无需辅助信息即可媲美最先进基线,推动了长视频 RAG 向结构化、意图感知推理的转变。
AI 推荐理由
提出结构化记忆架构解决长视频上下文限制,核心在于时空图记忆与意图感知检索机制。
研究机构
University of Queensland
University of California, Merced
Institute of Automation, CAS
Ant Group
论文信息