论文

OpenAI 隐私过滤器:跨语言、跨域的 PII 评估(跨 32 个基准)

OpenAI Privacy Filter: A Cross-Lingual, Cross-Domain PII Evaluation Across 32 Benchmarks

模型评测鲁棒性、公平性与可信度评测

摘要

据我们所知,我们对 OpenAI 的隐私过滤器 (OPF) 进行了首次系统评估,OPF 是一个 1.5B 参数模型,可将自回归语言模型转换为双向 PII 检测器,涵盖 14 种语言和 5 个领域的 32 个基准。我们最实际可行的发现是依赖于领域的标记数据交叉:微调的 XLM-RoBERTa 超越了 OPF 的零样本性能,在英语合成 PII 上仅约 500 个标记示例(在非英语 Kiji 上约 100 个),在合成医疗 PII 上仅约 1000 个标记示例。至关重要的是,在小 n 时,每类 微调(17 个 PII 实体类型,OPF 33 的子集)的数据效率低于二进制标签——n=100,二进制 F1=0.634 与每类 0.360 相比。零样本情况下,OPF 在 SPY 医疗基准上达到 F1=0.464,在 AI4Privacy 上达到 F1=0.855,大大优于 Presidio 和 XLM-RoBERTa-large-NER。然而,OPF 在其 PII 训练分布之外急剧下降:在一般 NER 基准上 F1=0.04--0.40,并且在非拉丁文字中崩溃(阿拉伯语:0.04,西里尔语:0.03)。错误分析显示,OPF 在结构规则的 PII 上表现出色(电子邮件:0.78,电话:0.76),但在处理文化可变实体(人名:0.40,地址:0.49)方面表现不佳,并且在大多数 PII 域中存在召回偏差(精度 0.31--0.54,召回 0.70--0.85)。我们提供了何时使用 OPF 零样本、何时微调 XLM-RoBERTa 以及要避免哪些语言系列的启发式决策。