论文
编辑工作台
RedactionBench
摘要
大语言模型 越来越多地应用于需要编辑个人身份信息 (PII) 的敏感域。虽然编辑 PII 是数据清理的先决条件,但现有基准将提取机制与隐私语义混为一谈。公用电话号码并不等同于医疗记录中的电话号码。信息是否构成违规在很大程度上取决于谁持有该信息、为什么持有该信息以及在什么背景下持有该信息,这从根本上区别了编辑与简单的实体识别。基于上下文完整性,我们引入了 RedactionBench,这是一个手动注释的基准,包含 11 个领域的 200 个不同文档,大部分来自现实世界的来源。我们还引入了 R-Score,这是一种新颖的字符级指标,它平等地对待语义上相似的修订,并取消浅层格式选择,例如电话号码的不同屏蔽样式。对命名实体识别模型、实体提取小语言模型和配备代理工具的前沿模型的评估表明,上下文编辑仍然是一个未解决的问题。 RedactionBench 上对 80 多名用户进行的人工评估揭示了隐私认知上的鲜明分歧。注释者对强制密文(89.4%)和安全文本保留(94.1%)的目标标签达成共识,但未能就上下文密文达成一致(47.7%)。这种差异证明了上下文隐私的主观本质,并激发了 R-Score,它将上下文模糊性与严格的精确度脱钩。我们比较了不同系列的 35 个模型,并报告了它们在编辑 PII 方面的表现。最后,我们发布了RedactionBench,为未来的隐私保护系统建立基线,希望能够激发高效的模型设计和标准化评估。