论文
通过测试生成探测基于 LLM 的代码生成中的隐私泄露
Probing Privacy Leaks in LLM-based Code Generation via Test Generation
摘要
大规模代码数据集的广泛可用性推动了用于代码相关任务的 大语言模型 (LLM) 的快速发展。这些数据集可能包含敏感的个人身份信息(PII),当LLM记忆和复制它时,可能会导致隐私泄露。然而,现有的隐私泄露检测方法依赖于临时提示构造(手动或自动设计)。因此,它们不能充分近似 PII 出现在代码语料库中的真实环境,从而难以提取真实的隐私泄露情况。在本文中,我们提出了一种模拟实际隐私相关代码生成场景的管道,并采用测试驱动策略从生成的测试用例中引出记忆的信息。我们进一步引入了一个自动构建的隐私特征库,它通过提供真实的模板和示例来指导测试用例生成来取代手动提示工程。对 5 个广泛使用的 LLM 进行的大规模实验表明,我们的管道暴露了更多已确认的隐私泄漏,与现有基线相比,检测到的泄漏增加了 2.56 倍。