VideoLLM Streaming Reasoning Real-time Interaction Chain-of-Thought
摘要

针对在线视频大模型缺乏同步逻辑推理流且测试时扩展导致高延迟的问题,本文提出视频流式思维(VST)范式。该机制支持“边看边想”,在视频流传输过程中激活推理,通过分摊计算延迟实现实时响应与连贯认知。研究构建了包含结构化微调与基于自我探索的强化学习的全流程后训练管道,并利用视频知识图谱合成带有实体关系 grounding 的流式思维链数据。实验表明,VST 在多个在线基准上表现优异,显著提升了推理效率与泛化能力。

AI 推荐理由

论文核心提出“边看边想”机制,解决流式视频中的同步逻辑推理与延迟权衡问题。

研究机构
华中科技大学 小米集团
论文信息
作者 Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo et al.
发布日期 2026-03-12
arXiv ID 2603.12262
相关性评分 9/10 (高度相关)