论文
合成数据生成的激活指导:多样性在下游安全检测中的作用
Activation Steering for Synthetic Data Generation: The Role of Diversity in Downstream Safety Detection
摘要
安全检测模型需要 HHH(有帮助、无害、诚实)违规输出的示例来实现稳健的泛化,但这样的示例很少。激活引导 (AS) 已成为一种用于生成目标概念一致响应的数据高效方法。我们研究 AS 是否可以为下游分类器生成高质量的训练数据集,这是一个尚未测试的问题。我们提出了一项双重研究,对 $4$ 概念 $\times\,2$ 模型 $\times\,4$ 转向方法进行内在和外在评估。从本质上讲,除了引导成功(概念对齐)和一致性的现场标准规则之外,我们引入了样本和集合级别的多样性作为以前文献中没有的质量轴,并发现增加引导强度会降低响应多样性。从外部来看,我们用引导生成和微调检测分类器替换了可用训练数据中违反 HHH 的示例。对于 $3$ 的 $4$ 概念,AS 生成的数据比提示生成的数据产生更好的分类器。然而,136 的 AS 配置中只有 41 的表现优于提示,这表明下游效用位于一个狭窄的体系中,同时满足成功、一致性和多样性。与单独的成功和连贯性相比,这三个轴的调和平均值与下游 AUROC 的相关性在概念上更加一致,为从业者调整 AS 超参数提供了实用的启发式目标。总之,我们的结果凸显了 AS 在改进安全检测的合成数据生成中的潜力,并将多样性确定为调整 AS 的一个关键的、以前被忽视的轴。