论文
DECODEM:通过增强方法从公司组织文档中提取数据
DECODEM: Data Extraction from Corporate Organizational Documents via Enhanced Methods
摘要
许多实证法律研究依赖于将非结构化文本转化为结构化变量。在公司治理研究中,与其他地方一样,这种翻译传统上依赖于章程和章程等文件的人工编码,这一过程成本高昂、难以扩展,而且往往不透明。本文介绍了 DECODEM,这是一组用于评估从组织文档中自动提取公司治理变量的基准数据集。这些基准将随机抽样的公司章程和细则与高质量的人工注释配对,涵盖了实证工作中常见的一系列治理条款。使用这些数据集,本文评估了几种在提示设计、任务分解和文档处理方面有所不同的大型语言模型提取管道。底层任务由一组文档级二元分类问题组成,每个问题对应一个治理变量。结果表明,对于许多规定来说,自动提取在高精度上是可行的,并且各种方法的中值性能接近上限。与此同时,不同变量的表现存在系统性差异,少数规定导致了大部分剩余错误。更精细的提示策略和级联管道并不能持续提高前沿模型的性能,但在某些情况下大大缩小了前沿模型和效率导向模型之间的差距,这表明管道设计可以部分替代模型能力。通过提供标准化基准和对提取方法的系统评估,本文证明当前的前沿模型可以从复杂的公司文档中高精度地提取具有法律意义的信息,并提出自动特征提取在构建公司治理数据集方面的重要未来作用。