视觉记忆 流式视频理解 自适应压缩 多模态 Agent
摘要

本文提出 FluxMem,一种无需训练的流式视频理解高效框架。该框架采用分层两阶段设计自适应压缩冗余视觉记忆:首先通过时间邻域选择模块去除相邻帧间的冗余视觉令牌,其次利用空间域整合模块将帧内重复区域合并为紧凑表示。为适应动态场景,我们在两模块中引入自适应令牌压缩机制,依据场景内在统计量自动确定压缩率。实验表明,FluxMem 在现有在线视频基准测试中取得最先进结果,显著降低延迟与显存占用,同时保持优异的离线性能。

AI 推荐理由

论文核心提出自适应分层记忆架构,专为流式视频中的视觉记忆压缩与管理设计。

研究机构
复旦大学可信人工智能研究院 上海创新 institute 上海关键多模态人工智能实验室
论文信息
作者 Yiweng Xie, Bo He, Junke Wang, Xiangyu Zheng, Ziyi Ye et al.
发布日期 2026-03-02
arXiv ID 2603.02096
相关性评分 9/10 (高度相关)