论文
把LLM对齐从正则中隔离出来:对抗变异下的零覆盖与度量依赖分歧
Isolating LLM Alignment from Regex: Zero Coverage and Metric-Dependent Divergence Under Adversarial Mutation
摘要
生产LLM应用常在模型侧对齐前堆叠一个正则过滤器;既往工作发现在活跃正则过滤器后加装在线Gemini后端无可测的覆盖增益。我们要问:当语料被设计为绕过正则时,这一上限是否仍成立。我们引入L5-no-regex——与L4-real相同(Gemini-2.5-flash、token预算上限、限速、输出净化)但禁用九模式过滤器——并以N=45个对抗探针跨三个子语料(结转、正则绕过、对齐隔离)评估,经Gemini改写与PAIR放大为约1,555对探针—运行、N=5次重复。在主substring分类器下H1被驳回:L5的拦截率在全部五个OWASP LLM Top-10类别上为0%(对L0的Δpp=0,p=1.00;Wilson上界<5%)。PAIR变体上的次要LLM裁判指标显示56–100%的拦截率(p<0.01)——揭示对齐确实响应对抗框架的探针,但产生的拒绝太过微妙、substring匹配捕捉不到。子语料差分预测不成立(p=1.00)。对齐的贡献是度量依赖的:在自然语言有害请求探针上,它在正则之外增加零覆盖;在对抗框架变体上,LLM裁判能检出substring分类器漏掉的拒绝。锁定语料、变异工件与导出脚本已发布以供复现。