摘要
视频事件预测要求模型从部分视频证据推断未观察到的未来状态。现有视频多模态大模型通常在文本空间进行中间推理,导致细粒度运动与几何线索丢失,引发视觉无依据的幻觉。本文提出 Future-L1,一种交错潜在视觉推理框架,允许模型在自回归解码中交替使用语言令牌与连续潜在视觉跨度。通过构建 Future-L1-50K 数据集并采用 LA-DAPO 强化学习目标优化潜在轨迹,该方法在 FutureBench 和 TwiFF-Bench 上均取得最先进结果,证明保留潜在空间中的中间视觉语义优于将每一步推理转化为文本。
AI 推荐理由
论文核心提出交错潜在视觉推理框架,旨在解决视频事件预测中的推理幻觉问题。
研究机构
University of Science and Technology of China
City University of Hong Kong
Nanjing University
Shanghai AI Laboratory
Zhejiang University
University of Electronic Science and Technology of China
论文信息