论文

LegalBench-BR:评估巴西法律决策分类 大语言模型 的基准

LegalBench-BR: A Benchmark for Evaluating Large Language Models on Brazilian Legal Decision Classification

模型评测基准与评测资源

摘要

我们推出 LegalBench-BR,这是第一个评估巴西法律文本分类语言模型的公共基准。该数据集包含来自圣卡塔琳娜州法院 (TJSC) 的 3,105 个上诉程序,通过 DataJud API (CNJ) 收集,并通过 LLM 辅助标记和启发式验证在五个法律领域进行注释。在类平衡测试集上,BERTimbau-LoRA 仅更新 0.3% 的模型参数,实现了 87.6% 的准确率和 0.87 宏 F1(比 Claude 3.5 Haiku 多了 22pp,比 GPT-4o mini 多了 28pp)。这一差距在行政法(行政法)上最为显着:GPT-4o 迷你分数 F1 = 0.00,Claude 3.5 Haiku 分数 F1 = 0.08,而微调模型达到 F1 = 0.91。两种商业LLM都表现出对civel(民法)的系统性偏见,吸收模糊的类别而不是歧视它们,这是域适应的微调消除的故障模式。这些结果表明,即使任务是简单的 5 类问题,通用 LLM 也无法替代巴西法律分类中的领域自适应模型,并且消费级 GPU 上的 LoRA 微调 以零边际推理成本缩小了差距。我们发布了完整的数据集、模型和流程,以实现葡萄牙法律 NLP 的可重复研究。