历史推理 基准测试 证据推理 中国科举
摘要

尽管大语言模型(LLM)已辅助文本处理等历史任务,但其专业级历史推理能力尚待探索。现有基准多侧重基础知识或词汇理解,缺乏对史料论证推理等高阶技能的评估。为此,本文提出 ProHist-Bench,这是一个基于中国科举制度的新颖基准,涵盖东亚一千三百多年的政治、社会及思想史微缩图景。该基准包含八个朝代的 400 道专家策划难题及万余条细粒度评分标准。对 18 个模型的评估显示,即便最先进模型在处理复杂历史研究问题时仍存在显著能力缺口。

AI 推荐理由

论文核心评估 LLM 在历史研究中的高阶证据推理能力,直接针对推理短板。

研究机构
State Key Laboratory of Blockchain and Data Security, Zhejiang University Zhejiang University
论文信息
作者 Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu et al.
发布日期 2026-04-27
arXiv ID 2604.24690
相关性评分 9/10 (高度相关)