论文
测试时安全调整
Test-Time Safety Alignment
摘要
最近的工作表明,模型的输入词嵌入可以作为有效的控制变量,将其行为转向满足所需属性的输出。然而,这仅在预训练的文本完成模型中得到证明,其目标相对简单,即在短的延续中减少表面脏话。一个自然且实际重要的问题是输入嵌入如何控制对齐模型,从而产生不平衡的双峰“拒绝或遵守”输出分布,而不是开放式生成的平滑分布特征。我们在安全的背景下对此进行了探索,表明输入词嵌入可以以子词汇方式进行优化,以最大限度地减少对齐模型响应的语义危害。我们的方法针对输入嵌入使用黑盒文本审核 API 的零阶梯度估计,然后对这些嵌入应用梯度下降,以最大限度地减少生成文本的危害。实验表明,所提出的方法可以消除标准安全基准上的每个安全标记响应。