Video Event Prediction Chain of Events Logical Reasoning MLLM
摘要

尽管多模态大语言模型(MLLM)在各类视频任务中取得进展,视频事件预测(VEP)仍探索不足。VEP 要求模型进行细粒度时序建模并建立视频与未来事件的逻辑关系,而这正是当前 MLLM 的短板。本文首先评估了主流 MLLM 在 VEP 任务上的表现,揭示其预测不准源于逻辑推理能力缺失及视觉信息利用不足。为此,我们提出“事件链”(CoE)范式,构建时序事件链以隐式引导模型关注视觉内容及逻辑连接,并通过多种训练协议激励模型的推理能力。实验表明,该方法在公开基准上优于现有开源及商业 MLLM,确立了 VEP 任务的新最先进水平。

AI 推荐理由

论文提出事件链范式,核心旨在增强 MLLM 对视频与未来事件间的逻辑推理能力。

研究机构
AMAP, 阿里巴巴集团
论文信息
作者 Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu
发布日期 2026-03-16
arXiv ID 2603.14935
相关性评分 9/10 (高度相关)