论文
量化语言模型蒸馏中的隐性行为迁移
Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation
摘要
旨在将良性行为转移到学生模型的语言模型 蒸馏 也可能会转移不良特征(如果教师模型中存在这些特征),这种现象称为潜意识学习。虽然定性证据支持这种效应的存在,但其严重程度尚未得到系统表征。本研究通过以不同的引导强度引导两个教师模型(Llama-2-7B-Chat 和 Qwen2.5-7B-Instruct)并仅使用良性数据蒸馏学生模型来量化潜意识行为转移率。使用 GPT-4.1 作为评估器对 100条JailbreakBench提示进行评估,表明传输是稳健的,但表现出不同的扩展行为。 Llama-2 表现出尖锐的阈值($τ= {0.25,0.32} \ \text{beyond} \ α= -0.15$),而 Qwen2.5 显示出连续且更高水平的转移($τ$ 高达 $0.61$)。