论文
TW-LegalBench:衡量台湾人的法律理解
TW-LegalBench: Measuring Taiwanese Legal Understanding
摘要
大语言模型 (LLM) 在不同的任务中表现出了令人印象深刻的能力,但它们在特定管辖区的法律推理方面的表现仍有待探索。我们提出了 TW-LegalBench,它利用台湾法律体系向公众开放的丰富官方语料库,填补了在以英语来源为重点的普通法基准和以简体中文来源为重点的民法基准中评估台湾法律 LLM 的空白。 TW-LegalBench 包含三种任务类型:(1) 涵盖 18 个专业领域的五年正式考试中超过 16,000 道多项选择题 (MCQ); (2) 117 道来自法律专业人员考试的开放式问答题 (OEQ),具有官方评分标准; (3) 超过 14,000 个法律判决预测 (LJP) 实例,涵盖数百个犯罪类别。我们使用 MCQ 的准确性、基于 OEQ 评分标准点的分解的 LLM 法官框架以及 LJP 的量刑准确性和法规引用指标来评估 13 个 LLM。我们的结果显示,表现最好的模型超过了合格律师的通过门槛(通过率:11%),但低于法官和检察官的通过门槛(通过率:1~2%)。对于 LJP 来说,虽然模型展示了合理的判决类型准确性和句子预测能力,但它们很难引用准确的法律文章。这些研究结果表明,对于 LLM 来说,可靠的法律文本生成仍然具有挑战性,尽管它们在资格考试中的表现接近人类水平。