摘要
本文提出 FluxMem,一种无需训练的流式视频理解高效框架。该框架采用分层两阶段设计自适应压缩冗余视觉记忆:首先通过时间邻域选择模块去除相邻帧间的冗余视觉令牌,其次利用空间域整合模块将帧内重复区域合并为紧凑表示。为适应动态场景,我们在两模块中引入自适应令牌压缩机制,依据场景内在统计量自动确定压缩率。实验表明,FluxMem 在现有在线视频基准测试中取得最先进结果,显著降低延迟与显存占用,同时保持优异的离线性能。
AI 推荐理由
论文核心提出自适应分层记忆架构,专为流式视频中的视觉记忆压缩与管理设计。
研究机构
复旦大学可信人工智能研究院
上海创新 institute
上海关键多模态人工智能实验室
论文信息