摘要

本文推出 BenGER 数据集,旨在评估大型语言模型在德国法律中基于归摄的推理能力。该数据集包含 596 个考试风格的自由文本法律案例任务和 531 个简短教义推理任务。研究评估了 12 种当代 LLM 系统,并引入与评分标准对齐的

AI 推荐理由

论文核心评估 LLM 在法律领域的归摄推理能力,构建专用基准并深入分析推理表现。

研究机构
Technical University of Munich (TUM) Ludwig Maximilian University of Munich (LMU) University of Konstanz University of Saarbrücken
论文信息
作者 Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier et al.
发布日期 2026-05-27
arXiv ID 2605.28183
相关性评分 9/10 (高度相关)