论文

区域设置条件的少样本提示可缓解使用小语言模型进行设备上 PII 替换时的演示反流

Locale-Conditioned Few-Shot Prompting Mitigates Demonstration Regurgitation in On-Device PII Substitution with Small Language Models

上下文与知识上下文工程

摘要

个人身份信息 (PII) 编辑通常会用占位符标记(例如 [PERSON])替换检测到的实体,从而破坏了编辑文本用于检索和命名实体识别 (NER) 训练的下游实用程序。我们提出了一个完全在设备上的管道,用一致的、类型保留的假值替代 PII:一个 1.5 B 专家混合词元分类器 (openai/privacy-filter) 检测跨度,一个 1 位 Bonsai-1.7B 小语言模型 (SLM) 提出名称、地址和日期的上下文代理,以及一个基于规则的生成器 (faker) 处理模式化字段。我们报告了一个比量化选择更重要的提示性发现:通过简单的固定三镜头演示,1 位 SLM 会逐字反省演示输出,而不管输入如何; 1.58 位 Ternary-Bonsai-1.7B 再现了字节相同的故障,排除了量化的原因。我们通过区域设置条件的旋转几次演示来解决这个问题:字符范围启发式选择一个区域设置纯池和每个输入的 MD5 哈希样本三个演示。通过修复,482/482 个独特的 Bonsai-1.7B 调用成功(无回声)并生成区域设置正确的代理,尽管 SLM 仍然从小型相同区域设置演示池中进行复制 - 我们量化了剩余的窄度。在包含 2000 个文档的多语言语料库中,在多语言评估器 (XGLM-564M) 下,混合困惑 (PPL) 在所有六个语言环境中都击败了 faker;在 6 个区域中的 4 个中,长度保留是三局两胜。在下游 NER(400 个训练/100 个测试,英语)上,redact 产量 F1=0.000,faker 0.656,原始 0.960;在包括混合的匹配 160/40 子集上,faker (0.506) 在 p < 0.001 时优于混合 (0.346)。我们将此报告为诚实的负面发现:SLM 代理生成更自然的文本,但训练分布的变化较少,下游 NER 从多样性中获益更多,而不是从自然性中获益。