论文
对安全分类器的边界目标成员推理攻击
Boundary-targeted Membership Inference Attacks on Safety Classifiers
摘要
安全分类器是生成人工智能系统中的重要保障,可在与 大语言模型 交互时过滤有害内容或识别有风险的用户。尽管有必要,但这些模型是在敏感数据集上进行训练的,包括有关自残和心理健康的讨论,从而引发了重要但知之甚少的隐私问题。成员推理攻击 (MIA) 允许攻击者推断用于训练模型的示例的成员资格。在这项工作中,我们假设识别分类器最不自信的示例可以为对手推断成员资格提供信息。这反映了泛化的局部失败,模型依靠记忆来解决训练集中的歧义。为了研究这个问题,我们引入了一种新的边界目标选择策略,该策略可以识别低置信度示例,从而放大训练集中示例成员资格的信号。我们的实验结果表明,在经过微调以检测可能需要情感支持的用户的分类器上,对手可以以 5% 的误报率恢复 19% 的安全分类器标记为表明用户痛苦的对话。这比仅使用最先进的 MIA 方法进行攻击的成本高出 3.5 倍。最后,我们描述了边界铺设示例,并表明基于内容的过滤对于保护无效,而现有的噪声策略可以有效减轻这些示例的敏感性。