论文

通过踪迹改写保护语言模型免受未授权蒸馏

Protecting Language Models Against Unauthorized Distillation through Trace Rewriting

模型训练合成数据

摘要

知识蒸馏是一种广泛采用的技术,用于将大语言模型的能力转移到更小、更高效的学生模型。然而,未经授权的知识蒸馏使用不公平地利用了开发前沿模型所投入的大量精力和成本。我们研究了修改教师生成的推理轨迹的方法,以实现阻止未经授权的蒸馏的两个目标:(1)\emph{反蒸馏},或降低查询响应的训练有用性,以及(2)\emph{API 水印},它将可验证的签名嵌入学生模型中。我们介绍了几种动态重写教师推理输出的方法,同时保持答案的正确性和语义连贯性。其中两个利用了大语言模型的重写能力,而其他则使用基于梯度的技术。我们的实验表明,简单的基于指令的重写方法可以实现强大的反蒸馏效果,同时保持甚至提高教师的表现。此外,我们表明我们的重写方法还可以实现高度可靠的水印检测,基本上没有误报。

通过踪迹改写保护语言模型免受未授权蒸馏
图1:基于指令的重写概览:(a)干净轨迹生成:教师模型𝒯使用标准生成指令p_g为给定任务(查询)q生成推理轨迹r。(b)重写:配备重写指令p_r的重写模型ℛ将r变换为r′,在保持效用的同时实现知识产权(IP)保护。