论文
模块化预训练实现访问控制
Modular Pretraining Enables Access Control
摘要
人工智能开发人员面临着双重用途的困境。一种人工智能能力可以帮助一个用户治愈一种疾病,也可以帮助另一个用户合成一种疾病。这种困境可以通过访问控制来解决,将双重用途的人工智能功能限制在具有合法需求的可信部署中。访问控制的标准参考是为不同的用户提供具有不同功能的单独模型。然而,训练和部署多个模型的成本高昂。为了应对这一挑战,我们提出了梯度路由辅助模块(GRAM),这是一种 预训练 方法,它将模块添加到神经网络中并有选择地更新它们以诱导专业化。在推理时消除模块会从网络中删除其功能,近似于基于过滤数据训练的模型。我们根据合成故事和涵盖病毒学、网络安全、核物理和专业代码的真实两用数据来评估 GRAM。这些实验表明,GRAM 会禁用目标功能,同时保留其余功能,并且在微调下比事后遗忘更好地抵抗它们的恢复。最重要的是,从 50M 到 5B 参数的 Chinchilla 最佳扩展分析表明,数据过滤模型和全数据模型之间的差距随着删除功能的扩展而扩大,但在保留功能上保持较小,并且 GRAM 密切跟踪数据过滤。 GRAM 的训练成本与支持的功能配置文件的数量无关,与我们的 5 个配置文件设置中的数据过滤相比,成本降低了 5 倍。