LMM Benchmark Reasoning Evaluation Education
摘要

针对现有基准无法反映真实考试复杂性的问题,本文提出 LiveK12Bench,一个动态、全学科的多模态基准。该基准包含 2000 多道源自最新真实试卷的验证题目,涵盖数理化生等学科。其创新点包括自动获取最新试题以防止数据泄露,以及提出“模拟考试”评估方案,测试模型端到端自主完成考试的准确与高效推理路径。实验表明,在严格约束下先进模型性能显著下降,暴露了其在复杂视觉布局等方面的推理缺陷。

AI 推荐理由

论文核心在于评估 LMM 在真实考试场景下的多学科研理能力,揭示其推理漏洞。

研究机构
Tencent PCG College of Computer Science and Technology, Zhejiang University
论文信息
作者 Xiaohan Wang, Mingze Yin, Yilin Zhao, Gang Liu, Dian Li
发布日期 2026-05-26
arXiv ID 2605.26781
相关性评分 9/10 (高度相关)