Long Video Understanding Hierarchical Graph Memory Agentic Retrieval Vision-Language Models
摘要

当前视觉语言模型难以处理数小时长视频,因全序列处理导致令牌爆炸与注意力稀释。本文提出 MemDreamer 框架,将感知与推理解耦,转化为代理探索过程。该框架增量构建分层图记忆,采用自顶向下三层架构进行语义抽象,并以捕捉时空因果关系的基图为基础。推理阶段,模型利用代理增强检索,通过“观察 - 推理 - 行动”循环遍历层级与逻辑边。实验表明,该方法在四个基准测试中达到最先进水平,仅用 2% 的上下文窗口即实现显著精度提升,确立了代理能力扩展为新范式。

AI 推荐理由

论文核心提出分层图记忆架构,解决长视频理解中的记忆存储与检索问题。

研究机构
Ant Group Zhejiang University Central South University
论文信息
作者 Cong Chen, Guo Gan, Kaixiang Ji, ChaoYang Zhang, Zhen Yang et al.
发布日期 2026-06-05
arXiv ID 2606.07512
相关性评分 9/10 (高度相关)