论文

LLM 中的测量、定位和消融对准特征

Measuring, Localizing, and Ablating Alignment Signatures in LLMs

模型推理解码与生成控制

摘要

对齐的语言模型通常表现出一种可识别的类似人工智能的风格,但它与 后训练 和内部表示的联系仍然知之甚少。在这项工作中,我们研究 后训练 是否引入或放大了类似人工智能的风格规律,以及这些规律是否具有本地化的内部签名。为此,我们在匹配的人类源前缀下比较人类文本、基础模型生成和对齐模型生成。与基础世代相比,对齐的世代显示出较低的人类语料库亲和力和较高的人工智能检测率,这表明 后训练 将生成的文本从人类语料库风格转变为检测器可见的类似人工智能的文本。然后,我们介绍 PASTA(后训练 对齐签名目标消融),这是一种 无需训练 方法,它根据对齐基残差对比度估计 后训练 对齐签名,并在解码期间消融相应的方向。在 11 个对齐模型和 6 个 AI 检测器中,PASTA 降低了大多数对齐模型的检测率;这种效应可以很好地跨探测器传递,并且不会通过随机方向再现。定性分析表明,各代 PASTA 仍然具有相关性和连贯性,同时表现出更大的风格变化。总之,这些结果表明,后训练 的类似人工智能的风格效果可以通过激活消融来测量、定位和因果测试。