摘要
大语言模型在法律基准测试中表现优异,但其在真实场景下生成开放域法律推理的能力尚待探索,尤其缺乏日本语境下的研究。本文构建了首个基于日本司法考试写作部分的评估数据集,要求模型从长叙事中识别法律问题并构建结构化论证。研究通过法律专家对模型回答的手动评估,揭示了当前模型在法律推理及幻觉方面的局限与挑战,为日本法律领域的 LLM 发展提供了重要基准。
AI 推荐理由
论文核心评估 LLM 在开放域法律场景下的推理能力,涉及问题识别与论证构建。
研究机构
RIKEN
Tokyo, Japan
Tokai University
Tokyo Metropolitan University
论文信息