论文
通过踪迹改写保护语言模型免受未授权蒸馏
Protecting Language Models Against Unauthorized Distillation through Trace Rewriting
摘要
知识蒸馏是一种广泛采用的技术,用于将大语言模型的能力转移到更小、更高效的学生模型。然而,未经授权的知识蒸馏使用不公平地利用了开发前沿模型所投入的大量精力和成本。我们研究了修改教师生成的推理轨迹的方法,以实现阻止未经授权的蒸馏的两个目标:(1)\emph{反蒸馏},或降低查询响应的训练有用性,以及(2)\emph{API 水印},它将可验证的签名嵌入学生模型中。我们介绍了几种动态重写教师推理输出的方法,同时保持答案的正确性和语义连贯性。其中两个利用了大语言模型的重写能力,而其他则使用基于梯度的技术。我们的实验表明,简单的基于指令的重写方法可以实现强大的反蒸馏效果,同时保持甚至提高教师的表现。此外,我们表明我们的重写方法还可以实现高度可靠的水印检测,基本上没有误报。
