摘要
理解长视频对具身智能体至关重要,因其效能取决于长期感知记忆的积累与利用。针对多模态大模型在处理长视频时随帧数增加导致性能下降的问题,本文提出 FocusGraph 框架。该框架利用轻量级可训练的场景标题选择器,基于图结构描述筛选相关片段,并结合无训练的稀疏流保留方法提取关键帧。实验表明,该方法在多个具身长视频问答基准上取得最先进结果,同时显著降低了推理时间。
AI 推荐理由
论文核心解决长视频理解中的感知记忆积累与组织问题,提出关键帧选择架构以优化记忆利用。
研究机构
AXXX
Yandex
MIRAI
FusionBrain Lab
论文信息