论文

ContractScrub:法律合同终审基准

ContractScrub: A benchmark for final review of legal contracts

模型评测基准与评测资源

摘要

法律工作因大量依赖文本处理,常被视为最暴露于 LLM 应用的领域之一。合同“清理”(scrubbing)——对交易协议进行错误与不一致性的最终审查——是一项特别适合自动化的任务,因为它是例行、费神、需要对长文档进行细致关注的工作。清理似乎也与前沿 LLM 在长上下文推理、一致性检查和命名实体识别(NER)方面的通用能力天然契合。尽管具有经济价值和自动化潜力,目前尚未有对 LLM 执行合同清理的正式评估。我们引入 ContractScrub,首个旨在评估合同清理能力的基准,包含由资深律师手工制作的合同,涵盖定义术语误用、引用错误、语言不一致等多样错误类别。前沿模型表现得出乎意料地差,只有一个模型达到 0.75 的宏平均召回率,尽管它们在看似相关的通用基准上表现强劲,这展示了当前模型的实际局限,以及针对狭窄领域、目标明确的基准对衡量现实影响的重要性。

ContractScrub:法律合同终审基准:论文配图
图2:ContractScrub构建流程。合同经来源采集并筛查既有结构问题(阶段1),标注既有起草错误(阶段2),再通过定向添加额外错误进行增强(阶段3),从而产生金标准答案。所有步骤均由经验丰富的律师完成。