Video Generation Reasoning Coherence Benchmark Evaluation Metric
摘要

视频生成模型展现出新兴的推理行为,确保生成事件在帧间保持因果一致性(即推理连贯性)至关重要。为此,本文提出 MME-CoF-Pro,一个全面的视频推理基准,旨在评估视频模型的推理连贯性。该基准包含 16 类共 303 个样本,涵盖从视觉逻辑到科学推理的范围。文章引入“推理得分”作为评估必要中间推理步骤的指标,并设置无提示、文本提示和视觉提示三种评估场景,以探究提示引导的底层机制。实验结果表明,当前视频模型推理连贯性较弱且与生成质量解耦,文本提示虽提升表面正确率但易导致不一致与幻觉,而视觉提示在结构化感知任务中有效但在细粒度感知上表现不佳。

AI 推荐理由

论文核心聚焦视频生成模型的推理连贯性评估,提出基准与指标,直接研究推理机制。

研究机构
东北大学 香港科技大学 ByteDance Seed 北京大学 NVidia
论文信息
作者 Yu Qi, Xinyi Xu, Ziyu Guo, Siyuan Ma, Renrui Zhang et al.
发布日期 2026-03-20
arXiv ID 2603.20194
相关性评分 9/10 (高度相关)