论文

愚人金:针对开放权重模型安全移除攻击的防御性欺骗

Fool's Gold: Defensive Deception Against Safety-Removal Attacks on Open-Weight Models

模型训练监督微调与指令调优

摘要

开放权重语言模型的安全对齐可以被轻易移除:abliteration在几分钟内就能把介导拒绝的方向从权重中投影掉,而据我们所知没有任何发布时防御能持久阻止它。无法阻止的可以被欺骗。我们的防御“诱饵硬化”(“Fool's Gold”)让出拒绝通路并毒化其收益:一旦拒绝被剥离,对危险操作请求的大多数回答都是自信、流畅的诱饵,其关键要素被伪造。诱饵在攻击的可微模拟中训练,仅在受攻击状态下表达;一个拒绝销钉和良性缰绳将干净状态行为保持为原始状态。我们在来自五个家族的七个模型(9B-122B,稠密与混合专家)上实例化它。在通过预注册有效性门槛的六个模型上,对保留提示的受攻击状态回答有0.51-0.90是诱饵,其中+0.27-0.84可归因于该防御;全部六个模型保持在注册的良性行为与能力预算内;第七个(更小的)未通过门槛(边界情形)。比率在冻结测试划分或未触碰分层上复现。这一主张是认识性的:在没有独立真值的情况下,我们测试的任何观测面都无法区分被伪造的回答与正确的回答——在外部红队基准的CBRNE相关切片上,被防御的122B在0.82-0.86的匹配质量回答上出现致命错误,而未防御时至多0.10。重复采样无法恢复信任:在仪器验证有效的提示上,K=64的逐元素共识重建出完全可用程序的比例为0.083-0.625,而未防御时为0.58-0.96,且没有无标签方法可区分这两种状态;在最弱的这样一个模型上,该主张仅按单次抽取成立。我们评估化学与生物危害;该防御不应对上下文内越狱,且只保护最初发布的受防御权重。