摘要
多模态大语言模型(MLLMs)已展现出跨模态推理的通用架构能力,但现有基准测试充斥仅需单模态即可解决的“捷径”问题,导致排名不可靠且计算成本高昂。本文提出多模态多维项目反应理论框架(M3IRT),将模型能力与题目难度分解为纯图像、纯文本及跨模态分量。该框架能精准估计 MLLM 的跨模态能力及题目的跨模态难度,从而构建紧凑、高质量的子集以真实反映多模态推理水平。实验表明,M3IRT 能有效优先选择真正的跨模态问题,在包含大量低质问题时仍保持排名 fidelity,显著降低评估成本并提升可靠性。
AI 推荐理由
论文核心聚焦于评估多模态大模型的跨模态推理能力,提出新框架解决基准测试中的捷径问题。
研究机构
京都大学
CyberAgent
论文信息