论文

SrDetection:代码 大语言模型 中数据泄漏检测的自引用框架

SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

模型评测评测方法与指标

摘要

评估代码 大语言模型(代码 LLM)需要可靠地检测数据泄漏,其中基准性能因在 预训练 期间暴露基准数据而人为夸大。现有的方法要么假设访问专有的训练语料库,依赖于脆弱的启发式方法(例如时间戳过滤),要么使用具有手动调整的不可概括阈值的外部参考集。为了解决这些限制,我们引入了 \textbf{SrDetection},这是一个统一的 \textbf{s}elf-\textbf{r} 参考泄漏检测框架,适用于灰盒(访问模型 logits)和黑盒(访问模型输出)设置。 SrDetection 生成基准样本的语义等效变体,并通过将模型在原始样本与其变体上的行为进行对比来检测泄漏,标记原始样本对于模型而言异常容易的情况。我们进一步设计了一个受控泄漏检测测试台,并在此环境中评估 SrDetection。在不同的模型和训练阶段,SrDetection 在强基线上将灰盒设置中的平均 F1 提高了 21.52 点,将黑盒设置中的平均 F1 提高了 14.46 点,展示了强大的、与阈值无关的泄漏检测。最后,对四个流行基准上的 15 个广泛使用的代码 LLM 进行的灰盒研究揭示了超出先前基于重叠的分析的基准特定泄漏模式\footnote{\footnotesize 源代码和数据可在 https://github.com/SMinL/SrDetectionCode 获取