论文

一些好的条款:比较 LLM 与结构化合同提取的领域训练小语言模型

A Few Good Clauses: Comparing LLMs vs Domain-Trained Small Language Models on Structured Contract Extraction

模型评测模型能力评测

摘要

本文评估了经过领域训练的小语言模型 (SLM) 是否能够以极低的成本在结构化合同提取方面优于前沿 大语言模型。我们针对五个前沿模型测试了 Olava Extract(一种自托管法律域混合专家模型)。 Olava Extract 在研究中取得了最强的聚合性能,宏观 F1 为 0.812,微观 F1 为 0.842,同时与测试的前沿模型相比,推理成本降低了 78% 至 97%。它还实现了最高的精确度分数,产生更少的幻觉和无支持的提取,这是法律工作流程中的一个重要区别,在法律工作流程中,幻觉会造成操作风险和下游审查负担。研究结果表明,高性能、可与人类媲美的法律人工智能不再需要最大的外部托管模型。更广泛地说,他们挑战了这样一种假设,即具有商业价值的企业人工智能能力必须与更大的模型、大量基础设施支出和集中托管的提供商保持联系。