论文
打破官僚主义:评估开源LLM以进行法律文件审查
Breaking Bureaucracy: Evaluating open-source LLMs for legal document review
摘要
在本文中,我们评估了合法自然语言推理(NLI)上的开源生成LLM。法律检查流程发生在特定领域,并且通常处理机密数据。这就需要使用不需要标记的训练数据的本地模型。我们在 ContractNLI 基准和两个 NLI4Wills 数据集上评估我们的模型。我们成功地重现了任务的基线(Span NLI BERT),并在同一任务上评估了多个开源LLM。我们分析了模型的无效率及其在温度设置和域中的稳定性。在生成模型中,Gemma-4 26B 表现最好,达到 81.2% 的准确率,甚至在一项指标上优于监督模型。在准确性方面,不可能用零样本方法击败监督模型。 Qwen-3.6 35B 在 ContractNLI 和法律遗嘱领域的其他数据集上都表现良好。我们的研究结果表明,当没有可用的监督数据时,零样本、开源、生成式LLM是现实世界合法 NLI 的可行替代方案。我们的代码可在 https://github.com/fbaratov/contractnli-llms. 获取