Multi-Image Reasoning Benchmark LVLM Olympiad Problems
摘要

大型视觉语言模型(LVLM)在奥林匹克级推理任务中取得了显著进展。然而,现有的多模态推理基准往往侧重于单图像分析,未能充分利用多图像间的上下文信息。本文提出了 OMIBench,这是一个旨在评估证据分布于多张图像时的奥林匹克级推理能力的基准。该基准涵盖生物、化学、数学和物理奥林匹克竞赛题目,并包含人工标注的推理过程及精确与语义匹配评估协议。实验表明,现有模型在该基准上存在显著性能差距,即使是最强的 LVLM 准确率也仅约 50%,确立了其作为研究多图像推理重要资源的地位。

AI 推荐理由

论文核心聚焦于评估和提升 LVLM 在多图像场景下的奥林匹克级推理能力,直接针对推理主题。

研究机构
Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology Central South University Fudan University Harbin Institute of Technology (Shenzhen) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University
论文信息
作者 Qiguang Chen, Chengyu Luan, Jiajun Wu, Qiming Yu, Yi Yang et al.
发布日期 2026-04-22
arXiv ID 2604.20806
相关性评分 9/10 (高度相关)