论文

覆盖范围而不是难度决定了激活探针需要多少合成数据

Coverage, Not Difficulty, Sets How Much Synthetic Data an Activation Probe Needs

模型评测模型训练合成数据评测方法与指标安全与风险评测

摘要

监控已部署语言模型的激活探针是在合成对话上进行训练的,并且探针需要多少个是开放的。我们针对三种监控概念、高风险情况、对人有害的回复以及不遵循用户指令的回复,在 14 个保留的评估分布和四个探测模型上跟踪 10-590 个合成样本的学习曲线,改变生成器 LLM 和提示的细节。需求由监控的内容决定:高风险和有害的探针与 Gemma-3-27B-IT 上的 80 个样本相比,其稳定水平在百分之几以内,指令探针需要的数量是其数倍,并且订购适用于三个较小的探针模型和真实样本(来自开发集)。之前的工作建议将一代预算花在广度、更多类型的数据上,而不是深度、更多类型的数据上。我们将概念所需的深度理解为拟合曲线的半增益大小,即掌握一半增益的样本数量。概念和分布占其方差的 42-45%,生成器、探测模型和提示细节占 10% 以下。 设置半增益大小值的是覆盖范围,而不是每种难度:分布需要饱和的同类样本数量。在所有三个概念下,每种评估分布都有一个中值半增益大小,为 7-11 个同类合成样本。不同之处在于一种样本转移到该概念的其他类型的程度,几乎完全处于高风险、较少有害和最少指导的情况下,这解释了生成样本和真实样本上的概念之间的大部分差距。因此,广度根据概念的不同而付出不同的代价:在指导下,多种类型是必要的,其中没有一种类型涵盖另一种类型,而在高风险情况下,多种类型几乎是多余的,其中一种类型涵盖了其余的类型。我们发布了评估套件、开发集和生成集。