论文

以编码器速度提供强大的多语言隐私标记

Strong Multilingual Privacy Tagging at Encoder Speed

模型训练监督微调与指令调优

摘要

隐私编辑必须删除个人信息,同时保留文本中表达的关系。我们开发了一种多语言命名实体标记器,具有细粒度的区别,支持各种编辑策略和方法,可以廉价地学习其他区别。我们对 35 种语言的前沿模型注释上的仿射跨度标记头微调多语言编码器,使用覆盖感知掩码重放映射的人类黄金,以便未注释的类型不会被视为负数,并通过学习的 +/-1 字符调整修复子字边界。在七种语言的 1,283 个人类黄金测试片段中,最佳测得的编辑 F1 为 88.8,而已发布的 GLiNER2 为 69.1,其中排除了 11 种不可代表性的类型(没有该豁免的情况下为 68.8),适应新训练数据的 GLiNER2 为 67.8,Microsoft Presidio 为 57.3,最佳发布的 OpenAI 隐私过滤器微调为 35.8。添加约 50,000 个带注释的训练句子并增加人类黄金回放,将 Ont3(我们对 1,201 个开发片段的 31 类型前沿注释 NER 评估)上的精确类型跨度 F1 从 74.5 提高到 76.3。仅映射黄金重播就将人类黄金 F1 提高了 10 点,且边界注释文本没有损失;边界调整在 Ont3 上添加 1.7 个精确类型跨度 F1 点。由于提示注释器和冻结编码器,适合单个 96 GB GPU 的本地 LLM 表现不佳,在评估的配置中编码比 XLM-R 推理慢 30-95 倍,提示注释大约慢 180-1,100 倍。该编码器架构可提供 GLiNER2 CPU 吞吐量的 4.9 倍。我们发布代码、提示和训练食谱,以及数据采集脚本和源链接。