Streaming Video Semantic Memory Multimodal Agents Reinforcement Learning
摘要

实时理解连续视频流对动态环境中的多模态代理至关重要。现有方法多采用批处理范式,导致高延迟且不适用于流式场景。本文提出 ThinkStream 框架,基于“观察 - 思考 - 表达”范式,使模型能随新观测增量更新理解。为支持长程流式处理,我们提出了推理压缩流式记忆(RCSM),将中间推理轨迹作为紧凑语义记忆,替换过时视觉令牌同时保留关键上下文。此外,利用可验证奖励的流式强化学习训练模型,以对齐增量推理与响应时机。实验表明该方法在低延迟和低内存占用下显著优于现有在线视频模型。

AI 推荐理由

提出推理压缩流式记忆机制,核心解决长程视频流中的记忆更新与上下文保留问题。

研究机构
中国科学院自动化研究所 中国科学院大学人工智能学院
论文信息
作者 Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He et al.
发布日期 2026-03-13
arXiv ID 2603.12938
相关性评分 9/10 (高度相关)