KV Cache Compression Streaming Video Coreset Selection Vision-Language Models
摘要

大型视觉语言模型进行流式视频理解需要紧凑的记忆以支持对不断增长的视觉历史进行推理。现有方法多依赖局部启发式策略压缩键值(KV)缓存,未能显式优化保留缓存的历史代表性。本文提出将 KV 缓存压缩视为核心集选择问题,旨在选取能覆盖累积视觉缓存几何结构的子集。该方法在联合 KV 表示下运行,引入平衡键与值空间覆盖的双目标函数,并正交驱动多样性标准以保留新信息方向。实验表明,在固定缓存预算下,该方法优于现有基线。

AI 推荐理由

论文核心解决流式视频理解中的紧凑记忆机制,提出基于核心集的 KV 缓存压缩方法。

研究机构
University of British Columbia Vector Institute
论文信息
作者 Ailar Mahdizadeh, Puria Azadi, Muchen Li, Xiangteng He, Leonid Sigal
发布日期 2026-05-14
arXiv ID 2605.14310
相关性评分 9/10 (高度相关)