论文
大语言模型 中用于缓解记忆的输出向量编辑
Output Vector Editing for Memorization Mitigation in Large Language Models
摘要
大语言模型 记忆并复制训练数据中的序列,从而产生隐私、版权和安全风险。现有的神经元级缓解方法将编辑等同于将神经元激活归零,但激活仅控制神经元是否参与;输出向量写入残差流,并通过叠加对多个特征进行编码。我们提出输出向量编辑,这是一种约束优化权重编辑,定位负责记忆延续的一小组 MLP 神经元,并最小化修改它们的输出向量以在词汇空间中引入干扰项,重定向它们的残余流贡献,同时保持激活不变。对从360M到7B参数的四个模型(SmolLM-360M、OLMo-1B、OLMo-7B、Llama2-7B)进行评估,我们以OLMo-7B(其开放权重和预训练语料库实现系统挖掘)为中心,挖掘6831个记忆序列,实现了高达87.9%的抑制。相同位置神经元上零消融的 2.7$\times$ 差距表明抑制来自输出向量编辑,而不是单独的本地化。四种编辑模式涵盖从积极抑制到最小重定向的范围;在整体中,它们覆盖了 96.5% 的记忆序列,而我们推荐的单模配置达到 81.5%,没有灾难性的局部故障。我们进一步确定了仅 MLP 编辑无法到达的序列 ${\sim}14%$ 处的机械边界;虽然这些失败总体上不是注意力驱动的,但消除贡献最大的注意力头可以恢复其中的 60--64%,从前缀复制词元的延续性恢复能力更强,将注意力定位为补充性后备机制,而不是主要机制。编辑模式排序和成功-局部性权衡在所有四个模型之间转移,成功率随模型大小而不是家族而缩放。