论文

L2W:定位并编辑大模型的指定语义行为

From Latents to Wires: Surgical Post-Editing on Large Language Models

模型训练模型编辑与遗忘

摘要

给定一个大语言模型(LLM),持有权重的人能否命名一个语义目标(例如模型的身份),找到生成它的模型组件,并对其进行编辑,以便目标不再出现,同时保留其他功能?我们将这种对经过训练的模型进行的编辑称为后期编辑。我们提出了 L2W(潜在的连线),这是一个对命名语义目标进行外科手术后编辑的框架。对于定位,L2W 使用雅可比透镜 (J-lens) 属性根据语义目标对组件进行评分。对于手术切除,由于 LLM 机制是多余的(即语义目标可能有多个组件生成它),L2W 运行反例引导因果剪切(CGCC),直到目标不再出现。 CGCC 首先累积关闭模型组件,将目标的每个幸存表达式视为暴露下一个要关闭的组件的反例,然后重新打开其中一些组件以保留功能。在植入行为水印的对照实验中,L2W 删除了水印,并将其定位到植入物更改的模型区域。在三种模型配置中,L2W 在所有九次运行中删除了模型元数据(例如身份)自我声明,并在所有三次运行中删除了成人内容拒绝,并且没有保留目标残差。 L2W 进一步对文本到图像模型进行了两个后期编辑:一个删除了对所请求的裸体的拒绝,第二个删除了第一个暴露的裸体渲染。结果支持后期编辑作为后期训练的补充:后期训练安装首选行为,后期编辑删除指定的不需要的行为。