摘要
针对现有基准无法反映真实考试复杂性的问题,本文提出 LiveK12Bench,一个动态、全学科的多模态基准。该基准包含 2000 多道源自最新真实试卷的验证题目,涵盖数理化生等学科。其创新点包括自动获取最新试题以防止数据泄露,以及提出“模拟考试”评估方案,测试模型端到端自主完成考试的准确与高效推理路径。实验表明,在严格约束下先进模型性能显著下降,暴露了其在复杂视觉布局等方面的推理缺陷。
AI 推荐理由
论文核心在于评估 LMM 在真实考试场景下的多学科研理能力,揭示其推理漏洞。
研究机构
Tencent PCG
College of Computer Science and Technology, Zhejiang University
论文信息