论文
论垃圾的硬度 LLM
On the Hardness of Junking LLMs
摘要
众所周知,大语言模型 (LLM) 容易受到越狱攻击,这种攻击通常依赖于精心设计的包含显式语义结构的提示。这些攻击通常通过修复对抗性指令并优化小的对抗性组件(例如后缀或前缀)来进行。在这种情况下,提示结构是性能的基础,最近的结果表明,即使是简单的随机搜索,与复杂的提示设计相结合也可以实现强大的性能。最近,人们发现,即使没有对抗性提示,仅依靠优化的词元序列也可以引发有害行为。这表明存在自然后门,即在 LLM 训练期间自然出现的词元序列,在没有任何有意义的指令的情况下触发不安全的输出。然而,尽管有这些观察结果,这种设置在很大程度上仍未被探索,特别是尚未评估寻找自然后门的难度。在这项工作中,我们提供了第一个概念验证研究,调查这项任务的难度,我们将其称为垃圾问题。我们将其形式化为寻找标记序列的问题,该标记序列最大化生成有害响应的目标前缀的概率,提出一种贪婪随机搜索方法来评估此类序列是否可以轻松发现。我们的结果表明,这个问题比标准越狱攻击更难,证实了语义信息在提示设计中的重要性。同时,我们发现我们的简单策略足以以很高的成功率解决该问题,这表明天然后门是存在的并且很容易恢复。最后,通过困惑度分析,我们观察到发现的标记序列位于模型分布的低概率区域,支持了它们从训练过程中隐式出现的假设。