论文
验证您的权威:在多标签先例治疗分类上对 LLM 进行基准测试
Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification
摘要
自动对法律先例中的负面待遇进行分类是一项关键而微妙的 NLP 任务,其中错误分类会带来重大风险。为了解决标准精度的缺点,本文引入了更稳健的评估框架。我们在包含 239 个现实世界法律引文的新的专家注释数据集上对现代 大语言模型 进行基准测试,并提出一种新颖的平均严重性错误指标,以更好地衡量分类错误的实际影响。我们的实验揭示了性能差异。 Google 的 Gemini 2.5 Flash 在高级分类任务上取得了最高的准确率 (79.1%),而 OpenAI 的 GPT-5-mini 在更复杂的细粒度模式上表现最好 (67.7%)。这项工作建立了一个关键的基线,提供了一个新的上下文丰富的数据集,并引入了一个针对这一复杂的法律推理任务的需求量身定制的评估指标。