论文
REDACT:系统控制的个人信息检测多语言基准
REDACT: A Systematically Controlled Multilingual Benchmark for Personal Information Detection
摘要
个人身份信息 (PII) 检测的基准基础设施仍然有限:现有语料库涵盖少数实体类型,使用临时生成条件,并且不显示哪些表面条件导致检测器故障。我们推出了 REDACT,这是一个系统控制的多语言 PII 基准,包含 13,427 条记录、324,078 个实体注释、51 种实体类型、4,127 种表面形式模式以及 9 种文字的 25 种语言。强度 2 覆盖阵列采样器控制九个生成轴:域、格式、难度、长度、密度、代码转换、语言、邻接和共现。三个实体级元数据字段(披露状态、披露表格和符合 GDPR 的敏感度层)可实现超出聚合或按类型 F1 的分层评估。根据完整的基准测试,我们在 1,000 条记录的锁定、语言分层样本上评估了五个检测器(Presidio、GLiNER、OpenAI Privacy Filter、GPT-4.1 和 Claude Sonnet 4.6)。聚合 F1 掩盖了依赖于架构的故障结构:基于规则的检测器在最高风险数据上表现不佳,包括高敏感度类别(召回率 0.07)和非逐字披露形式,而 LLM 检测器仍然更加稳健,高层作为其最强的敏感度切片。三模型无参考 LLM 作为法官评估证实敏感度层分配是任务最难的轴。我们发布了基准、架构、提示和分层评估工具。