论文

UA-Legal-Bench:评估乌克兰法律推理 大语言模型 的基准

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

模型评测基准与评测资源

摘要

法律 NLP 基准绝大多数以英语为中心,而形态丰富的非拉丁文字语言中的故障模式未被检测到。我们引入了 UA-Legal-Bench,这是一个用于评估乌克兰法律推理 大语言模型 的五任务基准,该基准基于统一国家法院判决登记册 (EDRSR)——世界上最大的开放司法语料库之一(9950 万个判决)。基准包括:(1)案件类型分类(4类,n=2,000),(2)判决形式分类(4类,n=2,000),(3)案件结果预测(6类,n=800),(4)法律规范提取(n=1,794),(5)原因类别预测(22类,n=1,871)。我们通过 AWS Bedrock 进行 158K API 调用,在零次和 3 次提示下评估来自 5 个系列的 11 个 LLM (3B--675B)。我们的结果揭示了与任务相关的小样本效应:小样本提示将判断形式分类提高了高达 +38.6 pp,但对结果预测的影响参差不齐。我们表明,在不平衡的法律任务上,准确性会产生误导:具有最高 COP 准确性 (62%) 的模型是多数类预测器(宏观 F1:23%),而真正最好的模型只有 44% 的宏观 F1 得分。族内扩展分析表明,8B 模型可以在表面级任务上达到前沿性能,但不同族之间的扩展阈值差异很大。我们发布所有数据、提示和模型预测。