论文

LLM-不可知语义表示攻击

LLM-Agnostic Semantic Representation Attack

模型评测安全与风险评测

摘要

大语言模型 (LLM) 越来越多地采用对齐技术来防止有害输出。尽管有这些保护措施,攻击者仍可以通过制作对抗性提示来规避它们。主要的 词元级 优化方法主要依赖于精确肯定模板的优化(例如,``\textit{Sure,here is...}'')。然而,这些范式经常遇到瓶颈,例如收敛欠佳、即时自然度受损以及跨模型泛化能力差等。为了解决这些限制,我们提出了语义表示攻击(SRA),这是一种与 LLM 无关的新颖范式,从根本上重新概念化了从精确文本定位到恶意语义表示的对抗目标。理论上,我们建立了语义一致性-收敛关系,并推导了跨模型语义泛化界限,证明保持语义一致性可以保证白盒语义收敛和黑盒可迁移性。从技术上讲,我们通过语义表示启发式搜索(SRHS)算法来操作该框架,该算法在增量离散词元块扩展期间保留对抗性提示的可解释性和结构一致性。广泛的评估表明,我们的框架在26个开源LLM上平均攻击成功率达到99.71%,具有很强的可转移性和隐匿性。