论文
无损抗蒸馏采样
Lossless Anti-Distillation Sampling
摘要
前沿商业生成模型面临着来自 蒸馏 的日益增长的威胁,其中蒸馏器收获生成的响应并以极低的成本训练竞争模型。现有的防御措施要么修改生成以降低 蒸馏 性能,牺牲响应质量,要么依赖可通过多帐户查询轻松绕过的行为检测机制。在这项工作中,我们提出了无损抗 蒸馏 采样(LADS),它使生成本身保持不变,同时大大降低了 蒸馏 的有效性。具体来说,LADS 通过耦合机制控制推理背后的潜在随机性,该机制保留账户内生成独立性,同时引入跨账户依赖性。通过构建,每个通常只持有一个帐户的良性用户在 LADS 下获得与没有任何防御时相同的体验,从而享受无损体验。然而,对于多帐户特定于任务的蒸馏器,跨不同帐户提交的语义相似的查询被分配耦合随机性,导致所收集数据的依赖性,从而降低蒸馏模型的泛化性能。使用一致收敛理论,我们证明 LADS 相对于标准 i.i.d 可以降低蒸馏器的泛化差距。采样。图像生成、数学推理和代码生成的实验证实,LADS 极大地降低了优秀学生的表现,同时保留了个人用户的精确统计保真度。