论文
蒸馏检测:通过墨盒 蒸馏 暴露 LLM 中的隐形偏差
Distill to Detect: Exposing Stealth Biases in LLMs through Cartridge Distillation
摘要
部署在高风险角色中的语言模型可能有利于某些实体、品牌或观点,从而大规模引导用户决策。这种偏好偏差可以由模型供应链中的任何参与者引入,并且当模型仅显示其对相关主题的偏好,同时在所有其他输入上的行为与其未修改的基础相同时,这种偏好偏差是最危险的。最近的工作表明,这些偏差可以通过上下文 蒸馏 传递到语义无关的数据上,信号完全驻留在软 logits 分布中,并且对基于文本的检查保持不可见。然而,防御者面临着一个根本性的不对称性:在不知道偏差主题的情况下,任何检测方法都无法可靠地揭示隐形偏好偏差,无论它是否检查生成的文本、内部表示或模型权重。在这里,我们介绍 Distill to Detect (D2D),这是一种通过将可疑模型与其基础之间的分布变化提取到卡盒(KV 缓存前缀适配器)中,集中显性差异并将偏差信号放大到生成文本中来显示隐藏偏差的方法。我们证明,D2D 成功地将隐形模型的隐藏偏差放大到可以跨多种偏差类型可靠地检测到的程度。我们还提出了一个理论框架,通过 logits 分布偏移的 Fisher 加权投影的镜头来解释 D2D 的功效,并得到经验观察的支持。通过将前缀调整适配器的容量瓶颈转变为检测工具,D2D 为审核已部署语言模型中的隐藏行为提供了实用的构建块。