论文
DUET:用同权重双教师分歧指导禁令遵循蒸馏
DUET: Dual-Teacher On-Policy Distillation via Same-Weight Disagreement for Prohibition Compliance
摘要
真实部署常按请求和租户注入不同禁令,如企业规则、个人信息红线和工具边界。监督微调的合规标签难呈现违反信号,序列级DPO偏好又不匹配词元局部的违规。DUET是词元选择式同策略蒸馏:两个教师参数完全相同,正教师看到禁令,负教师不看到;其词元分歧由禁令是否可见产生,而非容量差异。该分歧用于滤除一致词元中的冗余或被前缀污染的监督,并在词元级让学生远离负教师、接近正教师,将DPO式目标加入同策略蒸馏,无需离线偏好数据。工业禁令遵循基准覆盖五类任务,包含明确拒绝、改写鲁棒性和过度拒绝。1.5B–8B Qwen模型的遵循率达72.3%–85.2%,正常任务效用保持88%–93%,优于教师和所比蒸馏方法;SysBench外部评测显示安全对齐改善,GSM8K与MATH-500退化较小。