Multimodal Reasoning Benchmark Long Video Understanding Omni-modal
摘要

多模态大语言模型在单一模态评估中表现优异,但在长复杂视频中联合推理全模态信号的能力尚待探索。本文提出 MMOU 基准,包含 9038 个网络视频和 1.5 万个精心策划的问题,涵盖 13 类需跨模态与时序整合证据的基础技能。通过对 20 多个最先进模型的评估,结果显示现有模型在长视频全模态理解上存在显著差距,最佳闭源模型准确率仅 64.2%。研究揭示了系统性失败模式,为理解当前模型局限提供了深刻见解。

AI 推荐理由

论文核心在于评估多模态模型在长视频中的联合推理能力,构建基准以揭示推理缺陷。

研究机构
NVIDIA
论文信息
作者 Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar et al.
发布日期 2026-03-14
arXiv ID 2603.14145
相关性评分 9/10 (高度相关)