论文
LLM 服务中批量条件拒绝鲁棒性的配对测试协议
A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving
摘要
语言模型的安全评估通常将服务配置视为固定的后台基础设施,但只要可以在同步批处理中或在连续批处理调度程序中单独评估相同的提示,批处理条件就是未经测试的处理变量。我们将四项工件支持的研究综合成一个配对测试协议:研究 A 结合了本地发现、评分器校正裁决和真实批次确认;研究B测试跨模型泛化能力;研究C测试连续批次组合物;研究 D 运行批量不变内核消融。本地测试发现安全标签更改比功能标签更改更频繁(0.51% 与 0.14%),但对 63 个候选行的裁决仅留下 17 个真正的行为翻转,这意味着校正后的完整率为 0.16%。 15 模型扩展没有发现可检测到的通用安全性与能力偏差:翻转接近奇偶校验 (0.94x),对齐类型没有可检测到的关联 ($p=0.942$, $η^2=0.033$),输出不稳定性是最强的测试脆弱性屏幕 ($r=0.909$, bootstrap 95% CI [0.65, 0.97])。在目标内核消融中,标准 vLLM 在当前分数翻转候选上重现 22/55 标签翻转,同时启用 VLLM_BATCH_INVARIANT=1 将相同测试减少到 0/55 翻转;单独的成分测试发现在 4.7pp 灵敏度下没有聚集效应。测试建议是精确堆栈验证:评估所服务批次设置的拒绝,将安全提示与功能控制配对,并与聚合零效应分开报告低速率方向翻转。