论文
蒸馏 游戏:自适应攻击和高效防御
The Distillation Game: Adaptive Attacks & Efficient Defenses
摘要
蒸馏 攻击为模型提供者带来了部署权衡:使模型更有用的相同输出也可以使其更容易模仿。我们通过效用受限的教师和适应性强的学生之间的极小极大博弈来研究这种权衡。我们的框架产生易于处理的片面响应规则:一种自适应评估规则,其中学生重新加权高价值示例,以及一种教师方防御模板,用于抑制对 蒸馏 最有用的输出。例如,从廉价的代理值中,我们得出专家产品(PoE),这是一种简单的仅前向传递防御,在生成过程中将教师与代理学生结合起来。根据经验,适应性评估揭示了巨大的被动-适应性差距:在最先进的防御中,适应性学生恢复的能力比被动评估在 GSM8K 和 MATH 上恢复的能力要多得多。在这种更强有力的评估下,昂贵的防御和 PoE 之间明显的鲁棒性差距大大缩小,而 PoE 仍然便宜得多,并保留了更高质量的推理痕迹。总的来说,我们的结果表明,强大的 蒸馏 仍然难以阻止,反蒸馏的进展应该根据适应性强的学生而不是被动的学生来判断。我们的代码位于:https://github.com/ysfalh/蒸馏-game。