论文
认证式机制编辑:技能移除与保留的行为保证
Certified Mechanistic Edits: Behavioral Guarantees for Skill Removal and Preservation
摘要
机制编辑(消融、权重编辑、激活引导)是从神经网络中遗忘有害能力同时保留有用能力的标准工具。当前方法仅通过测试验证其效果——这永远无法覆盖连续输入区域。可解释性-验证边界上的既往工作认证的是模型的描述:某电路计算什么,或它是否忠实解释整体。我们转而认证编辑的行为效果:禁用某电路移除一项技能并可证保留另一项,对区域内每个输入成立——信息流安全意义上的特征非干扰保证。我们从玩具ReLU网络到标准softmax+LayerNorm transformer演示此类认证编辑:在连续嵌入空间区域上证明移除与保留,切换到可靠界传播后达到精确求解器可处理输入扰动维度的约9倍。此外我们证明:没有有限确定性黑盒测试能认证移除——展示一个通过穷举测试却在可任意缩小的幸存者口袋上可证失败的编辑。保证在小型标准架构网络上成立;且与任何移除声明一样,预设目标技能承认可判定规范——现实危害可能不具备该性质。