论文
SERSEM:代码语言模型中成员资格推断的选择性熵加权评分
SERSEM: Selective Entropy-Weighted Scoring for Membership Inference in Code Language Models
摘要
随着代码的 大语言模型 (LLM) 越来越多地利用大量且通常非宽松许可的数据集,通过成员推断攻击 (MIA) 评估数据污染变得至关重要。我们提出了 SERSEM(用于成员推断的选择性熵加权评分),这是一种新颖的白盒攻击框架,可以抑制无信息的语法样板以放大特定的记忆信号。 SERSEM 采用双信号方法:首先,通过静态抽象语法树 (AST) 分析、基于拼写检查的多语言逻辑检测和离线 linting 导出连续字符级权重掩码。其次,这些启发式权重用于汇集内部 Transformer 激活并根据输出 logits 校准 词元级 Z 分数。在 25,000 个样本的平衡数据集上进行评估,SERSEM 在 StarCoder2-3B 模型上实现了 0.7913 的全局 AUC-ROC,在 StarCoder2-7B 模型上实现了 0.7867 的全局 AUC-ROC,始终优于已实现的基于概率的基线 Loss、Min-K% Prob 和 PAC。我们的研究结果表明,关注以人为中心的编码异常可以提供比序列级概率平均值更可靠的逐字记忆指标。