论文
线性探针在人设坐标中泛化更好吗?
Do Linear Probes Generalize Better in Persona Coordinates?
摘要
让监控器在语言模型交互过程中检查有害行为变得越来越有必要,但仅文本监控还不够。这是因为模型有时会表现出战略欺骗和沙袋,从而在评估过程中改变其行为。这促使人们使用线性探针等白盒监视器,它可以直接读取模型内部结构。目前,此类探针可能会在分布变化的情况下失败,从而限制了它们在实际环境中的实用性。我们研究模型内部是否存在一个低维子空间,可以更稳健地捕获有害行为,同时忽略虚假的相关特征。受助理轴和角色选择模型的启发,我们使用对比角色提示构建用于欺骗和阿谀奉承的角色轴。第一个主成分是通过对角色特定向量进行无监督 PCA 获得的,可以清楚地区分有害和无害的角色。在 10 个评估数据集中,我们表明,角色派生的方向传输非常重要,并且在角色 PC 投影上训练的探针比在原始激活上训练的探针具有更好的泛化能力。我们还发现,由多种有害和无害行为组成的统一轴可以提高跨行为和数据集的泛化能力。总体而言,角色向量为构建更多可转移的行为探针提供了有用的归纳偏差。
