论文
利用知识编辑中的关联上下文检索对 LLM 构建白盒攻击
Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
摘要
由于 大语言模型 (LLM) 被授予越来越多的自主权,因此有必要研究可能诱发不安全行为的方法。我们提出了一种新颖的白盒攻击,其灵感来自于知识编辑领域的“定位然后编辑”方法。我们的选择是由于观察到使用此类方案编辑的模型倾向于为编辑目标分配异常高的预测概率,这一属性在设计攻击时特别有利。我们通过合并从模型中检索的关联知识来修改编辑框架,从而将约束删除扩展到整个主题类别,而不是仅限于来自预定义数据集的提示。各种架构的实验表明,与竞争方法相比,攻击效率有所提高,并且不会对一般模型性能造成严重损害。