长视频理解 关键帧选择 具身智能 感知记忆 多模态大模型
摘要

理解长视频对具身智能体至关重要,因其效能取决于长期感知记忆的积累与利用。针对多模态大模型在处理长视频时随帧数增加导致性能下降的问题,本文提出 FocusGraph 框架。该框架利用轻量级可训练的场景标题选择器,基于图结构描述筛选相关片段,并结合无训练的稀疏流保留方法提取关键帧。实验表明,该方法在多个具身长视频问答基准上取得最先进结果,同时显著降低了推理时间。

AI 推荐理由

论文核心解决长视频理解中的感知记忆积累与组织问题,提出关键帧选择架构以优化记忆利用。

研究机构
AXXX Yandex MIRAI FusionBrain Lab
论文信息
作者 Tatiana Zemskova, Solomon Andryushenko, Ilya Obrubov, Viktoriia Khoruzhaia, Ekaterina Eroshenko et al.
发布日期 2026-03-04
arXiv ID 2603.04349
相关性评分 9/10 (高度相关)