multimodal reasoning video generation benchmark evaluation framework
摘要

尽管通用视频模型进展显著,但其是否具备真正的多模态推理能力仍存疑。现有基准因任务设计简单且指标碎片化,无法严谨评估复杂推理。为此,本文提出 CLVG-Bench,通过视频生成中的上下文学习探测零样本推理能力,涵盖物理模拟、逻辑推理等复杂场景。同时引入自适应视频评估器(AVE),以最少标注实现类人专家评估。实验表明,即便最先进模型在逻辑 grounded 和交互式生成任务上表现严重不足,揭示了多模态推理的关键瓶颈。

AI 推荐理由

论文核心评估视频模型的多模态推理能力,构建基准测试逻辑与物理推理瓶颈。

研究机构
浙江大学 ByteDance
论文信息
作者 Xiaotian Zhang, Jianhui Wei, Yuan Wang, Jie Tan, Yichen Li et al.
发布日期 2026-04-21
arXiv ID 2604.19193
相关性评分 9/10 (高度相关)