论文

专家评估LLM在日本司法考试写作题上的开放式法律推理

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

模型评测基准与评测资源

摘要

大语言模型(LLM)已在法律基准上展现出强劲性能,包括司法考试的选择题部分。然而,它们在现实场景中生成开放式法律推理的能力仍探索不足。值得注意的是,据我们所知,在日本语境下此前没有任何研究或数据集涉及这一问题。本研究提出首个旨在评估LLM在日本司法辖区内开放式法律推理表现的数据集。该数据集基于日本司法考试的写作部分,其要求考生从长篇叙述中识别多个法律争点,并以自由文本形式构建结构化的法律论证。我们的核心贡献是由法律专家对LLM生成的回答进行人工评估,从而揭示法律推理中的局限与挑战。此外,我们对幻觉进行了人工分析,以刻画模型在何时以及如何引入先例或法律不支持的内容。我们的真实考题、模型生成的回答以及专家评估揭示了当前LLM在日本法律领域的发展里程碑。我们的数据集与相关资源将在线提供。