摘要
针对在线视频大模型缺乏同步逻辑推理流且测试时扩展导致高延迟的问题,本文提出视频流式思维(VST)范式。该机制支持“边看边想”,在视频流传输过程中激活推理,通过分摊计算延迟实现实时响应与连贯认知。研究构建了包含结构化微调与基于自我探索的强化学习的全流程后训练管道,并利用视频知识图谱合成带有实体关系 grounding 的流式思维链数据。实验表明,VST 在多个在线基准上表现优异,显著提升了推理效率与泛化能力。
AI 推荐理由
论文核心提出“边看边想”机制,解决流式视频中的同步逻辑推理与延迟权衡问题。
研究机构
华中科技大学
小米集团
论文信息