摘要
尽管大语言模型(LLM)已辅助文本处理等历史任务,但其专业级历史推理能力尚待探索。现有基准多侧重基础知识或词汇理解,缺乏对史料论证推理等高阶技能的评估。为此,本文提出 ProHist-Bench,这是一个基于中国科举制度的新颖基准,涵盖东亚一千三百多年的政治、社会及思想史微缩图景。该基准包含八个朝代的 400 道专家策划难题及万余条细粒度评分标准。对 18 个模型的评估显示,即便最先进模型在处理复杂历史研究问题时仍存在显著能力缺口。
AI 推荐理由
论文核心评估 LLM 在历史研究中的高阶证据推理能力,直接针对推理短板。
研究机构
State Key Laboratory of Blockchain and Data Security, Zhejiang University
Zhejiang University
论文信息