Multimodal LLM Video Reasoning Streaming Memory Online Interaction
摘要

针对多模态大语言模型在连续视频流多轮交互中面临的离线限制及在线推理弱、记忆早期衰减等问题,本文提出“边看边想”框架。该框架通过段级流式因果掩码和位置编码,在交互中保持连续的段级记忆,支持感知与生成重叠的高效推理流水线。基于 Qwen3-VL 的实验表明,该方法在单轮和多轮流式输入协议下均显著提升性能,同时在多轮场景中大幅减少输出 token 数量,有效增强了长程依赖建模能力。

AI 推荐理由

论文核心提出段级流式记忆架构,解决长程依赖与记忆衰减问题。

研究机构
中国科学院自动化研究所认知与决策智能计算系统实验室
论文信息
作者 Lu Wang, Zhuoran Jin, Yupu Hao, Yubo Chen, Kang Liu et al.
发布日期 2026-03-12
arXiv ID 2603.11896
相关性评分 9/10 (高度相关)