论文

CANARY:语言模型中 微调 污染的零标签检测

CANARY: Zero-Label Detection of Fine-Tuning Contamination in Language Models

AI 基础设施模型评测AI安全与内容治理基础设施安全与风险评测

摘要

攻击者可以通过毒害 微调 示例的 1% 来植入潜在的有害行为。污染对于每个输出级防御都是不可见的:有害行为潜伏在模型的隐藏状态几何中,并且在污染超过 7.5% 之前不会出现在生成的文本中。我们引入了 CANARY(通过神经激活表示产量的污染审核器),这是一种零标签检查点审核器,可以直接从未标记提示集上的两次前向传递中检测到这种隐藏的转变。 CANARY 通过稀疏自动编码器投射隐藏状态差异,过滤样式噪声以隔离有意义的语义漂移。它在 1% 污染下实现了 AUROC = 1.000(95% CI = [0.997, 1.000];Cohen's d = 3.28),在四种模型架构和两种训练范例中,比任何输出级方法触发的值低 7.5 倍,良性 微调 的误报率为零,并且对风格匹配和梯度噪声自适应攻击具有完全的鲁棒性。相同的 SAE 功能基础驱动完整的治理管道:经过 SAE 过滤的放大以比标准一代高 5 倍的速度发现潜在危害;分数排名提示产生 4.2 倍红队提升;在推理时抑制一些特定于污染的特征可以将伤害从 70% 降低到 10%,并且不会造成任何困惑度损失。 CANARY 是第一个零标签框架,仅用于检测、验证、优先排序和修复来自隐​​藏状态的供应链污染。