打破词元边界的安全:BPE 词元化如何在 LLM 对齐中产生可利用的差距
Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment
摘要
尽管留下了人类可读的提示,但字符级扰动绕过了现代 LLM 中的安全对齐。我们确定并测试了一个中心结构机制:BPE 标记化将安全关键单词分段为子单词片段,并且我们调查的三个公共对齐数据集不包含故意分段的输入。该机制是一个链,在五个模型系列(Qwen-3-4B、Qwen-2.5-7B、Gemma-3-4B、Llama-3.1-8B、Mistral-7B)上进行了端到端测试。针对安全词元碎片的优化会在 80-100% 被拒绝的 HarmBench 提示上翻转第一个词元拒绝触发器,其中 48% 的翻转产生真正有害的输出(每个模型 29-65%;差距与行为 ROC-AUC 0.66-0.98,汇总 0.84)。激活修补将中断的信号定位到最后 ${\sim}30\%$ 层;对齐数据扫描在 30,000 个示例中发现零碎片提示(在攻击相关强度下的阳性对照召回 $\geq 99\%$);定向突变实验将安全词隔离为破坏位点。在防御方面,68 单元网格(55 个经过训练的检查点)表明,没有任何 DPO 配置能够在具有封闭池大小混淆的三个系列上实现种子和池稳定的 ASR 封闭。在碎片提示上训练的 SFT 关闭了 3/5 个家庭的 ASR,但只能通过全局崩溃来提高对良性提示的拒绝,这表明在我们测试的 LoRA-16 配方下,缺失的分布是必要的,但还不够。为了区分选择性修复和整体崩溃,我们引入了 Conv-Benign,一种候选配对诊断。所有 ASR 声明均经过 3 位法官校准(不同法官的单元排名稳定;绝对水平 $\pm$18pp;参见 App.~B.13)。