论文
LeakageBench:编辑文档图像中的个人身份信息的文档级泄漏风险
LeakageBench: Document-Level Leakage Risk for Redacting Personally Identifiable Information in Document Images
摘要
现实世界中的个人身份信息 (PII) 编辑通常对文档图像(扫描、屏幕截图和 PDF 渲染)进行操作,其中 OCR 错误、布局结构和视觉噪声决定敏感信息是否真正被删除。现有的 PII 基准大多以文本为中心,无法衡量文档级别的编辑风险:即使错过一个标识符,页面仍然不安全。我们推出了 LeakageBench,这是一组包含 500 个文档图像的挑战集,其中包含 11,954 个符合 GDPR 的 PII 注释,涵盖直接标识符、链接键和上下文重新识别表面。我们使用实体级 F1、分组泄漏和文档级泄漏指标来评估通用 OCR 管道、商业和任务适应的 OCR 相关检测器以及无 OCR 视觉语言模型。代码解释器将 GPT-5.5 本地化 F1 从 0.090 提高到 0.249,但关键的页面级泄漏仍然是 0.968。这些结果表明,更强大的检测和工具辅助可以改善本地化,但不会使大多数页面可以安全发布。 LeakageBench 为文档图像中的高召回率、基于空间的 PII 编辑提供了诊断基准。