论文
易受攻击的代码搜索:代码语言模型的可转移攻击
Vulnerable Code Search: Transferable Attack for Code Language Models
摘要
可靠的代码检索对于开发人员的生产力和有效的代码重用至关重要。然而,当前支持搜索工具的神经代码语言模型(CLM)很容易受到针对非功能性文本元素的对抗性攻击。在本文中,我们介绍了一种与编程语言无关的、可转移的、利用此 CLM 漏洞的对抗性攻击。我们的方法扰乱代码片段中的标识符,而不改变代码片段的功能,从而人为地将代码与目标查询对齐。我们证明,即使使用较小的代码嵌入模型(例如 CodeT5+)计算,我们的攻击也是非常有效的,并且可以转移到更大的闭源嵌入模型,例如 Voyage-code-3 或 LLM(例如 Gemini-3.1-Pro)。我们的攻击可以增加查询与任意、不相关的代码片段之间的相似性,从而使关键检索指标(例如最先进模型的平均倒数排名(MRR))降低高达 77%。实验结果凸显了当前代码搜索方法的脆弱性,并强调需要更强大的、语义感知的方法。