论文

阈下学习是引导向量蒸馏

Subliminal Learning Is Steering Vector Distillation

模型评测模型行为与机制分析

摘要

阈下学习指学生语言模型在教师模型的输出上微调时习得教师的特质(例如系统提示引发的对猫头鹰的偏好),尽管这些输出在语义上与那些特质无关。没有语义含义的数据何以能传递特定的语义特质,目前仍知之甚少。在这项工作中,我们表明阈下学习由单个引导向量(steering vector)介导,即一个加到模型激活上的向量。在两个开源模型上,我们发现教师的系统提示可以被一个引导向量很好地近似,而学生的行为源于在微调中学到一个对齐的向量。无法被引导向量很好近似的系统提示不会被阈下习得。这是引导向量蒸馏的一种特例:在受引导教师输出上训练的学生学会模仿该引导。我们在一系列语义向量和随机向量上演示了引导向量蒸馏。向模型激活添加语义向量会对其行为产生模型无关和模型特定(即非语义)两类影响,因此非语义的生成数据也能传递一个具有语义效应的向量,从而使阈下学习成为可能。这也解释了为什么阈下学习不能在模型间迁移。我们发现自适应优化器是语言模型出现阈下学习的必要条件:受引导数据上的激活梯度沿引导方向带有一个微小但持续的分量,而非自适应优化器会让离群梯度占主导,从而阻碍这一过程。

阈下学习是引导向量蒸馏:论文配图
图 1:在潜意识学习中,学生模型学习一个引导向量来继承老师的偏见。当系统通过偏好提示参考模型时,其激活会向 vteacherv_{\text{teacher}} 方向移动。当学生根据该教师提供的任意语义数据进行微调时,其学习方向 vstudentv_{\text{student}} 与 vteacherv_{\text{teacher}} 一致。学习 vstudentv_{\text{student}} 允许学生在行为上近似于 vteacherv_{\text{teacher}} 的引导。