论文

通过连续熵变化检测基于流畅优化的对抗性提示

Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes

AI 基础设施AI安全与内容治理基础设施

摘要

基于优化的对抗性后缀可以越狱对齐的 大语言模型 (LLM),同时保持流畅,削弱静态和基于窗口困惑的检测器。我们将对抗性后缀检测视为 词元级 下一个词元熵流上的在线变化点检测问题。使用 LLM 系统提示来估计稳健的基线,我们标准化用户词元熵并应用单边 CUSUM 统计。由此产生的检测器 CPD Online (CPD) 与模型无关,无需训练,在线运行,并定位对抗性后缀的起始位置。在 1,012 个基于优化的后缀攻击(GCG、AutoDAN、AdvPrompter、BEAST、AutoDAN-HGA)和 1,012 个困惑控制的良性提示的基准上,CPD 在所有六种开放权重聊天模型(LLaMA-2-7B/13B、Vicuna-7B/13B、 Qwen2.5-7B/14B)。在 LLaMA-2-7B 上,在规范 CUSUM 设置 ($k=0$) 下,CPD 达到 AUROC $0.88$ 和 F1 $0.82$。除了提示级检测之外,CPD 将 79.6% 的触发因素集中在对抗性后缀内,而窗口困惑的触发因素为 17-46%。最后,当用作 LLaMA Guard 的轻量级门时,CPD 在大容量、良性主导的部署中将警卫呼叫减少了 17-22%,同时保持警卫级检测质量