论文

使用 Post-Transformer 适配器纠正语言模型中抑制的对数概率

Correcting Suppressed Log-Probabilities in Language Models with Post-Transformer Adapters

模型训练模型编辑与遗忘

摘要

尽管保留了隐藏表示中的知识,但经过对齐调整的语言模型经常抑制政治敏感主题的事实对数概率。我们展示了一个 786K 参数(大约为基本模型的 0.02%)的 Transformer 后适配器,在冻结隐藏状态上进行训练,纠正了 Qwen3-4B、8B 和 14B 中 31 个意识形态歧视事实的这种抑制。适配器会记住所有 15 个训练事实,并在每个尺度的 5 个随机分割中泛化到 16 个保留事实的 11--39%,通过锚定训练实现零知识回归。门控 (SwiGLU) 和非门控(线性瓶颈)适配器都取得了可比的结果;两者都始终优于对方(Fisher 精确 p > 0.09 在所有尺度上)。在指令模型上,适配器会纠正对数概率排名。当在生成过程中应用于所有词元位置时,适配器会产生不连贯的输出;然而,当仅应用于当前预测位置(仅最后位置)时,适配器会生成连贯的、审查较少的文本。在词元投影之后运行的 logits 空间适配器无法在任何应用模式下产生一致的生成,这表明隐藏状态干预是生成校正的正确级别。 Apple MLX 中之前未记录的静默梯度错误解释了这项工作早期迭代中的所有空结果:标准模式 nn.value_and_grad(model, fn)(model.parameters()) 返回零梯度而不会出现错误;正确的模式 nn.value_and_grad(model, fn)(model, data) 可以解决这个问题。我们提供了最小的复制并讨论了使用 MLX 进行其他适配器研究的影响。