论文

通过影响函数检测受污染的代码生成提示批次

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

AI 基础设施AI安全与内容治理基础设施

摘要

大语言模型 (LLM) 越来越多地用于代码生成,但它们仍然容易受到引发不安全实现的提示的影响。现有的防御通常依赖于预定义的威胁模型或已知的漏洞模式,限制了它们针对新型攻击的有效性。我们提出了 CodeSIFT,这是一种与威胁模型无关的检测方法,它利用影响函数来识别引发异常模型行为的批量提示。 CodeSIFT 不是检测特定的漏洞,而是测量生成的代码的参数空间影响,并使用统计测试来确定候选提示集是否偏离良性参考分布。为了评估我们的方法,我们引入了两个涵盖各种漏洞的基准数据集。我们在从 3B 到 7B 参数范围的三个开放权重代码 LLM 上评估 CodeSIFT,在中等到高注入速率下实现高达 0.98 的 AUROC 分数,同时保持良好校准的误报率并大大优于静态分析基线。这些结果表明,基于影响函数的检测是识别恶意代码生成提示的一个有前途的方向,而无需事先了解底层攻击类别。