论文

REINS:利用稀疏自编码器特征进行拒答增强的抑制性引导

REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features

模型推理解码与生成控制

摘要

使用稀疏自动编码器 (SAE) 进行引导提供了一种轻量级推理时间路径,无需重新训练即可适应大语言模型的行为。通过暴露稀疏且可解释的特征,SAE 引导为安全控制提供了一个有前途的接口,可以引导有害的延续走向拒绝。然而,我们观察到复杂的包装器仍然会破坏针对有害提示的现有 SAE 引导方法。为了系统地评估这种故障模式,我们构建了广义卧底指令安全评估(GUISE),这是一个带有复杂包装的有害提示的数据集。现有的单向 SAE 引导方法不能可靠地对有害提示产生拒绝,这表明当有害延续路径保持活动状态时,单独的拒绝增强可能太弱。这促使我们提出拒绝增强抑制转向(REINS),它抑制有害的连续特征并增强同一 SAE 特征空间中的安全拒绝特征。 GUISE 和其他数据集上的实验表明,先前的方法要么干预太弱,要么只能通过崩溃实现表面安全,而 REINS 大大减少了有害反应,显着提高了安全拒绝能力,并在很大程度上保留了一般能力。

REINS:利用稀疏自编码器特征进行拒答增强的抑制性引导:论文配图
图1:REINS更可靠地抑制了有害的延续性,并引导模式走向安全拒绝。