论文

TAME:针对紧急错位的词元归属和屏蔽

TAME: Token Attribution and Masking for Emergent misalignment

模型评测模型行为与机制分析

摘要

在狭窄、有缺陷的数据上微调对齐的语言模型可能会引发远远超出训练领域的有害行为,称为紧急错位 (EM)。先前的工作已将 EM 定位在模型权重、激活和训练文档中,但仍不清楚哪些训练标记携带相关的微调信号。我们引入了 TAME(词元归因和紧急错位屏蔽),这是一个三阶段框架:词元归因使用已发布的 LoRA 适配器的前向传递来对微调更新提高每个响应词元可能性的强度进行评分;信号表征发现高归因标记中的模式;因果验证通过归因引导的损失掩蔽来测试它们。在发布的 EM 生物体和 6,849 个医学建议样本中,归属是集中的(前 5% 的标记占据了 32​​% 的质量),并且在 Llama 中,即使在控制了标记稀有性之后,医学词汇也被耗尽,但不必要的确定性记录却被丰富了。在新的微调过程中屏蔽高归因标记,使 Llama 中的 EM 降低了 23 倍,Qwen 中的 EM 降低了 36 倍,而困惑度成本集中在目标寄存器而不是医疗内容上;相等的随机掩码使 EM 保持不变。在 Llama 中,归因模式表明,与 EM 相关的信号更多地在于如何自信地表达有缺陷的内容,而不是其领域词汇;因果掩蔽效应本身适用于两个模型系列。