论文

大语言模型中的不完整提示越狱

Incomplete Prompt Jailbreaks in Large Language Models

模型评测安全与风险评测

摘要

大语言模型(LLM)日益以带危害请求防护的开放权重形式发布。然而,句子补全仍易受不完整有害提示攻击。本工作把该现象形式化为不完整提示越狱(IPJ),并系统实证刻画不完整提示何时、如何诱发有害续写。我们分析与不完整句子续写相关的多样吸引子类型,证明LLM系统性地把拒绝延迟到句子终止之后;进一步证明经参数调优训练模型拒绝不完整有害提示并不充分——无法跨内容域与吸引子类型泛化。为实现细粒度控制,我们识别两类功能神经元:终止神经元与续写神经元。通过厘清它们在句子补全中的角色,我们凸显神经元级干预在实现更精确、更稳健IPJ防御上的潜力。

大语言模型中的不完整提示越狱:论文配图
图 1:不完整提示通过吸引子引发有害延续的图示。这项工作通过持续吸引子和神经元水平终止机制来分析该现象。