论文

先回答后编辑:使用保留实用程序对 Anti-蒸馏 进行推理骨架编辑

Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility

AI 基础设施AI安全与内容治理基础设施

摘要

专有的 大语言模型 (LLM) 需要大量的智力和财务投资,使其成为宝贵的知识产权 (IP)。然而,即使通过黑盒 API 部署,这些模型仍然容易受到未经授权的 知识蒸馏 的攻击,这使得攻击者可以廉价地提取和复制模型功能。为了解决这个问题,提出了反 蒸馏 (AD) 来生成阻碍 蒸馏 有效性的防御输出,克服依赖于事后验证的基于水印的方法的局限性。然而,现有的基于内部模型扰动的 AD 方法很难平衡推理痕迹的反蒸馏性和效用(例如答案准确性和自然性),更强的防御往往会导致严重的效用损失。为了填补这一空白,我们提出 \textbf{\underline{S}}keleton-\textbf{\underline{G}}uided \textbf{\underline{R}}easoning \textbf{\underline{E}}diting (SGRE),一个 \textit{Answer-then-Edit} 框架,用于针对 蒸馏 执行事后跟踪修改。在回答阶段,教师模型首先生成干净的推理痕迹,保留原始推理准确性,同时能够更灵活地控制痕迹自然度。在编辑阶段,我们从认知负荷理论(CLT)中汲取灵感,引入了由推理骨架提取、骨架图粗化和骨架语言化组成的三阶段策略。这些操作共同扰乱推理结构并增加文本复杂性,从而放大学生模型的额外负载,阻碍他们获取潜在的推理模式。针对不同 LLM 的大量实验表明,SGRE 在降低 蒸馏 有效性方面实现了最先进的性能,同时保持无损推理准确性和卓越的跟踪自然度。