论文
反射和片段:保护LLM免受连续马赛克攻击
Reflections and Fragments: Securing LLMs Against Sequential Mosaic Attacks
摘要
自博红队通过让攻击者和防御者角色在零和游戏中相互对抗来提高语言模型的安全性。然而,真正的对手越来越多地使用马赛克攻击:多轮序列,其各个片段孤立无害,但却组装成有害的有效负载。我们开发了一种马赛克防御理论,该理论描述了在不牺牲有用性的情况下防止此类攻击所需的条件。我们首先表明,一般来说,最近提示的固定有界窗口是不够的:安全相关信息可能在交互中任意遥远的地方出现。我们形式化了一个守望者,一种传递这些信息的在线状态机制,并表明在明确的假设下,它可以实现具有积极良性帮助的零故障防御。在更强的条件下,它在零故障防御者中也是最优的。然而,精确的监视者可能需要指数级的多个状态,而精确的恶意检测可能需要非结构化黑盒模型中指数级的多个查询。这些状态和查询下界本身并不意味着学习困难:状态下界的基础结构可以从标记的示例中有效地学习,而证明最坏情况的安全性可能需要在限制访问的情况下需要更多的信息。我们还表明,自我博弈平衡本身并不能证明有用性,从而激发了一种约束公式,可以最大限度地提高零故障防御者中最坏情况下的良性帮助。根据经验,训练角色特定的攻击者和防御者 LoRA 适配器通过多回合自我对战在冻结的LLM上增强了这两个角色:攻击者在引发有害响应方面变得更加有效,而防御者对攻击变得更加鲁棒,在看不见的攻击目标上也观察到了改进。