论文
用于检测人工智能生成证据的 CIFAR 合成证据语料库
The CIFAR Synthetic Evidence Corpus for Detecting AI-Generated Evidence
摘要
生成模型生成真实文件的能力不断增强,对司法系统和法院的证据工作流程构成了直接挑战,因为司法系统和法院的决策越来越依赖于收据、通信和行政记录等证据的真实性。与社交媒体或学术环境不同,证据文件通常只会进行细微的修改,进行小的局部编辑,在改变法律含义的同时保留整体合理性。然而,自动检测的进展仍然有限,很大程度上是由于缺乏特别适合司法系统要求的适当训练和评估数据。现有资源要么集中在人脸或自然风景的照片上,要么集中在范围狭窄的学术或社交媒体文档类型上,并且没有捕捉现实世界证据数据的结构、多样性或操纵模式特征。因此,当前的检测系统不一定能够学习适合司法系统的有意义的信号。我们引入了 CIFAR 合成证据语料库,这是一个旨在在现实和受控条件下对证据验证进行严格评估的数据集。该语料库涵盖多个文档族和一系列操作策略,从小型现场编辑到完整的文档制作,并使用多种最先进的生成工具构建。它的组织方式是系统地改变操作复杂性和生成方法,同时强制训练和测试数据之间的源级分离,以反映现实世界的泛化挑战。