论文
VAR:借同人小说语域测试对齐模型的安全薄弱点
Voices Across Registers: Corpus-Conditioned Vernacular Jailbreaks against Aligned LLMs via Fanfiction Subgenres
摘要
已有对齐模型越狱通常是特定提示,表面形式容易识别和修补。研究认为更广泛的失效可能来自安全训练覆盖不足的自然写作语域。VAR以Archive of Our Own(AO3)的12种同人小说子流派作为通用攻击载体,用其中段落约束创意写作元提示,并将有害行为嵌入场景高潮。构造无需攻击者LLM或优化。在HarmBench与JailbreakBench合并任务、八种对齐模型、四评判器集成评测中,平均攻击成功率由0.278升至0.731;因子分解显示增益来自语域,而非长度或结构。两种主动防御反而扩大语域攻击相对基线的效果比,说明针对模板的防御可能让攻击转向语域。静态四轮扩展VAR-A4的平均攻击成功率为0.924,高于三种已有多轮方法。代码与数据公开于 https://github.com/T-Lab-CUHKSZ/VAR 。