论文
LLM 作为鉴别器:当合成表看起来仍然真实时
LLM-as-a-Discriminator: When Synthetic Tables Still Look Real
摘要
隐私和数据共享常常处于紧张状态。许多组织使用合成数据来降低隐私风险,同时仍然共享有用的数据。对于表格数据,审计隐私仍然很困难。在许多情况下,即使是人类也无法轻易辨别桌子是真实的还是合成的。在本文中,我们提出了一种基于 LLM 判别的方法。我们要求 LLM 将每个表样本分类为“真实”或“合成”。我们测试两种设置:C1 仅包含表,C2 包含表和分布式元数据。我们使用 LLaMA 作为开放模型,使用 Gemini 作为参考模型。在我们的实验中,我们在两个公共数据集(UCI Adult 和 ACS Census)上运行了三个综合模型:CTGAN、TVAE 和 Gaussian Copula。我们收集了 451 个有效试验。我们的结果显示模型之间存在明显差异。在 Adult 上,LLaMA 在报告的细胞中达到 DRS=0%,而 Gemini 在 CTGAN 和 TVAE 中达到 DRS=100%。在人口普查中,LLaMA 预测大多数样本为 SYNTHETIC,而 Gemini 在 C1 中保持较高水平,但在 C2 中 CTGAN 和 TVAE 则下降。我们还与分类器双样本测试 (C2ST) 进行比较,并将链接记录作为分布基线,并与 2 个注释者和 240 个试验的人类飞行员进行比较。我们的结果表明,当模型选择、每个提供商的报告和数据编码得到谨慎处理时,LLM 歧视是一个实用的隐私审核信号。为了重现性,代码和实验脚本可在 https://github.com/SlokomManel/LLM-as-a-Discriminator 上找到。