论文
保持评估公平:通过成员推理攻击检测代码生成基准中的数据泄漏
Keep Evaluation Fair: Detecting Data Leakage in Code Generation Benchmarks via Membership Inference Attacks
摘要
代码生成基准广泛用于评估 大语言模型 (LLM),但基准数据泄漏到训练集中可能会夸大性能并破坏评估有效性。 DetectLeak 是一种专门为代码生成基准泄漏检测而设计的方法,它依赖于困惑度分数来识别可能泄漏的样本。然而,困惑主要反映了对代码模式的普遍熟悉程度,并且在复杂或稀有样本上可能表现不佳。它还忽略了其他有用的信号,例如代码相似性、功能正确性和语义表示。为了解决这些限制,我们提出了 CGMIA(特定于代码生成的成员推理攻击),这是一种检测代码生成基准中泄漏的方法。 CGMIA 在基准样本子集上微调影子模型,以构建标记的成员和非成员数据。对于每个样本,它都会收集输入提示、生成的代码和参考解决方案,并提取专家特征,包括 CodeBLEU、编辑距离、测试通过率和困惑度,以及来自 CodeBERT 嵌入的语义特征。集成学习模块结合了这些功能,以捕获表面级记忆信号和更深层次的行为模式,使分类器能够预测样本是否包含在目标模型的训练集中。对八个代码生成基准的实验表明,CGMIA 在大多数情况下优于八个现有的成员推理方法。它还可以有效地检测 StarCoder-7B 训练数据中已知的泄露 APPS 样本。