Multimodal Reasoning Item Response Theory Benchmark Evaluation Cross-modal Integration
摘要

多模态大语言模型(MLLMs)已展现出跨模态推理的通用架构能力,但现有基准测试充斥仅需单模态即可解决的“捷径”问题,导致排名不可靠且计算成本高昂。本文提出多模态多维项目反应理论框架(M3IRT),将模型能力与题目难度分解为纯图像、纯文本及跨模态分量。该框架能精准估计 MLLM 的跨模态能力及题目的跨模态难度,从而构建紧凑、高质量的子集以真实反映多模态推理水平。实验表明,M3IRT 能有效优先选择真正的跨模态问题,在包含大量低质问题时仍保持排名 fidelity,显著降低评估成本并提升可靠性。

AI 推荐理由

论文核心聚焦于评估多模态大模型的跨模态推理能力,提出新框架解决基准测试中的捷径问题。

研究机构
京都大学 CyberAgent
论文信息
作者 Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima et al.
发布日期 2026-03-03
arXiv ID 2603.02663
相关性评分 9/10 (高度相关)