摘要
本文推出 BenGER 数据集,旨在评估大型语言模型在德国法律中基于归摄的推理能力。该数据集包含 596 个考试风格的自由文本法律案例任务和 531 个简短教义推理任务。研究评估了 12 种当代 LLM 系统,并引入与评分标准对齐的
AI 推荐理由
论文核心评估 LLM 在法律领域的归摄推理能力,构建专用基准并深入分析推理表现。
研究机构
Technical University of Munich (TUM)
Ludwig Maximilian University of Munich (LMU)
University of Konstanz
University of Saarbrücken
论文信息