论文

渠道位置限制了潜意识学习的可审核性

Channel Location Constrains the Auditability of Subliminal Learning

模型评测安全与风险评测

摘要

潜意识学习让学生从 蒸馏 从未命名的数据中继承老师的隐藏特质。我们询问何时可以在预训练对此类转移进行审核。答案不仅仅是模型身份或规模,而是渠道位置:特质到达学生的载体。我们发现了三种制度。在受控的依赖于初始化的身体通道中,预训练 屏幕可以工作。覆盖率(学生的初始 蒸馏 更新与教师的 微调 位移之间的余弦)预测保留转移(Spearman $ρ\approx 0.95$;AUROC 0.997)。在预训练的语言模型中,掩盖单标记特征而不是聚合词汇几何。该通道与初始化无关,因此初始化对齐屏幕(包括覆盖范围)不是机械的;有用的方法是事后检测和有针对性的缓解。即使从损失中删除了单词元命名实体,学生对该实体的保留概率平均也会上升到 0.40 ($\sim 2500\times$),并且相关的语义类会发生转移。在无束缚头模型中,将特征的输出行与纠缠的邻居正交化会破坏泄漏,而同等大小的随机子空间编辑则不会。因此,从 蒸馏 标签中删除目标字符串不会删除相应的首选项:相邻标记可以携带它。最后,条件行为可以通过网络主体进行路由。对于阿谀奉承,由于协议和修正标记被损失掩盖,迁移达到了教师效果的约 0.63,本地化到身体计算,并逃避了两个模型系列的四次审核。我们将此视为有条件保单的隐蔽转移。渠道定位对于决定哪些审核是合理的至关重要。它不是一个部署就绪的屏幕:在其运营商制度之外使用的审计可能会提供错误的保证。