论文
安全操作员:通过谱优化调节安全指令的表达
The Safety Operator: Modulating the Expression of Safety Instructions via Spectral Optimization
摘要
基于转换器的语言模型中的上下文标记可以作为乘法运算符吸收到模型的权重中。我们在安全指令设置中研究了该运算符,并表明影响其主导特征值可以调节指令塑造生成的强度。我们得出了具有抑制权重的对比安全损失,该抑制权重控制了强调有害查询的安全指令与抑制无害查询的安全指令之间的权衡。改变抑制权重可以映射攻击成功与过度拒绝率之间的关系,支持操作员的特征值充当指令影响力的连续刻度盘的假设。此外,这种关系相对独立于如何参数化安全损失,从而为适当的抑制权重值产生帕累托改进的安全指令。