零温度下的 推测解码:具有 48,072 个样本扩展的范围安全不变性屏幕
Speculative Decoding at Temperature Zero: A Scoped Safety-Invariance Screen with a 48,072-Sample Expansion
摘要
推测解码 通过让草稿模型提出词元供目标模型进行验证来加速推理,从而提出一个具体的安全问题:在温度为零时,草稿侧行为是否会泄漏到安全评分输出中?我们用典型接受不变性屏幕 (TAIS) 进行回答,这是一种行为等效屏幕,它将同一安全测试集上的仅目标输出和推测输出配对,并需要逐字节一致性证据、+/-3pp 的 TOST 等效性以及低于校准零截止值 |h| 的每任务 Cohen h。 < 0.1.应用于 16,783 个样本验证核心加上 44,066 个匹配的扩展样本(fp16/bf16 执行、规范和 DPO 对抗草案、GPTQ-4 位草案、两个种子和四个安全基准)时,经过测试的零温度 vLLM 堆栈在 TAIS 下没有显示出可检测到的安全分歧。仅匹配目标与投机拒绝的最大绝对科恩 h 为 0.024,大约比传统的微不足道效应下限低一个数量级; 27 个每任务 TOST 对比中有 25 个以 +/-3pp 的差值通过(两个未通过对比是能力域 Wald-CI 边缘情况,上限率相同,而不是真正的不等价); DPO 对抗性草案在 4,006 个样本中产生与规范草案字节相同的输出; bf16 更改了 36%-53% 的输出字节,而没有将任何每个任务的安全率移至等效值之外。一个单独的 4,006 个样本的 70B 生产规模探针缺乏匹配的 70B 仅目标臂,因此不计为 TAIS 通过,在 700 个 AdvBench 完成中产生 AdvBench 拒绝 0.839,威尔逊 CI 为 95% [0.809, 0.864]。我们对采样温度、未经测试的框架、未经测试的模型系列或树推测变体(例如 EAGLE 和 Medusa)不做任何声明。