论文
ContractScrub:法律合同终审基准
ContractScrub: A benchmark for final review of legal contracts
摘要
法律工作因大量依赖文本处理,常被视为最暴露于 LLM 应用的领域之一。合同“清理”(scrubbing)——对交易协议进行错误与不一致性的最终审查——是一项特别适合自动化的任务,因为它是例行、费神、需要对长文档进行细致关注的工作。清理似乎也与前沿 LLM 在长上下文推理、一致性检查和命名实体识别(NER)方面的通用能力天然契合。尽管具有经济价值和自动化潜力,目前尚未有对 LLM 执行合同清理的正式评估。我们引入 ContractScrub,首个旨在评估合同清理能力的基准,包含由资深律师手工制作的合同,涵盖定义术语误用、引用错误、语言不一致等多样错误类别。前沿模型表现得出乎意料地差,只有一个模型达到 0.75 的宏平均召回率,尽管它们在看似相关的通用基准上表现强劲,这展示了当前模型的实际局限,以及针对狭窄领域、目标明确的基准对衡量现实影响的重要性。
