论文
开放式 LLM 微调 防御容易受到简单攻击
Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
摘要
最近保护开放权重 大语言模型 (LLM) 的防御措施旨在防止对抗性使用。这些防御的基础是一个假设,即新的有害行为是通过 微调 学习的,而不是通过越狱模型引发的。然而,预训练的 LLM 已经编码了许多领域的大量有害知识,这提出了一个重要问题:对手是否可以越狱受保护的模型,从而在没有 微调 的情况下实现有害使用?在本文中,我们表明开放权重防护措施容易受到更简单策略的影响,尽管这些策略众所周知,但尚未针对这些防护措施进行系统评估。具体来说,我们评估了两种不依赖于基于梯度的优化的低成本攻击——消除和预填充。在三个危害性评估基准(BeaverTails、HarmBench 和 AdvBench)中,这些攻击将针对受保护的开放权重模型的攻击成功率从低于 10% 提高到 16%-96%。为了减轻这个漏洞,我们引入了抗消除调整(ART),它将基于消除的目标纳入训练中。 ART 可以分层到现有防御上,并将消除、预填充及其组合的成功率降低 10%-20%。这些发现表明,开放权重模型的攻击面比之前描述的更广泛,并且对防护防御的评估应该包含除对抗性 微调 之外的更多样化的攻击策略。