论文
黑盒的有界行为不可区分性 LLM 蒸馏
Bounded Behavioral Indistinguishability for Black-Box LLM Distillation
摘要
黑盒 LLM 蒸馏 通常被评估为输出匹配问题:当学生的回答在语义上与教师的回答相似或任务一致时,该学生被认为是成功的。然而,输出相似性并不意味着学生在行为上与其模仿的模型没有区别。我们引入了有界行为不可区分性,形式化为在显式提示分布上的 $(ε,q,t,\mathbb{A})$-行为不可区分性,其中 $ε$ 限制区分优势,$q$ 限制预言机查询,$t$ 限制计算,$\mathbb{A}$ 表示对手类。我们使用受控的 5,000 提示行为探针套件在 Qwen 和 Llama 师生对上实例化了这一概念。对于每个家庭,我们将老师与基础学生和 LoRA 蒸馏学生进行比较,衡量 蒸馏 是否降低了可区分性,而不仅仅是提高了相似性。 LoRA 将 Qwen 的语义相似度从 0.788 提高到 0.862 ,将 Llama 的语义相似度从 0.814 提高到 0.874 。然而,对抗性评估揭示了剩余的行为差异:学习鉴别器保留非零优势,成对类别分析显示工件集中在风格/格式、鲁棒性和领域技术提示上。成对的教师识别对手证实了这一趋势。通过不同家庭的 Llama 法官和 A/B 交换一致性过滤,Qwen 的区分优势从基础学生的 $0.158$ 下降到 LoRA 蒸馏 后的 $0.081$。查询预算实验表明,分歧引导的采集并不总是优于分层随机抽样,这表明覆盖率和多样性仍然是强大的基线。我们的结果表明,语义保真度是有用的,但还不够:黑盒 LLM 蒸馏 需要有界的、对抗性的和类别感知的评估。