论文
实用攻击面:大语言模型 中隐式上下文的漏洞
Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models
摘要
在大语言模型(LLM)时代,攻击者经常操纵自然语言来引出不安全或有害的输出,从而创建基于LLM的系统独有的新自然语言攻击面,其中攻击直接利用用户提示中的显式语言线索来绕过LLM的安全机制。然而,此类攻击通常可以通过现有的安全对齐算法来缓解。另一方面,人类语言本质上是基于语用学的,需要典型的语境来解释语言,例如世界知识、社会规范。然而,此类上下文通常是隐式的,因为它们不直接用人类语言表达,并且在安全对齐中没有得到充分利用,从而在人类语言解释和安全对齐方法之间造成了根本的不匹配。在本文中,我们证明这种不匹配会暴露 LLM 中的漏洞。我们将此漏洞称为实用攻击面,利用该漏洞可实现较高的攻击成功率。实验结果表明,我们提出的方法在各种开源和闭源模型中明显优于基线攻击方法。