论文
召回不是保护:根据模型合规性评估安全监控器
Recall Is Not Protection: Evaluating Safety Monitors Against Model Compliance
摘要
安全监视器屏幕提示发送到已部署的语言模型,标记有害请求,使它们永远不会得到答复。它们是通过针对危害性标签进行召回来评估的,但只有在模型符合要求的情况下,捕获才能防止伤害。我们直接测量差异:我们对目标模型的重复响应进行采样,如果模型至少符合一次,则将有害提示称为\emph{可诱导},并分别报告可诱导和不可诱导提示的监视器召回率。在六种显示器配置和三个模型系列中,涵盖激活探针、微调文本防护和 120B 策略条件推理分类器,在固定误报率下,可引发提示的召回率比不可引发提示的召回率低 0.22 至 0.38。监视器错过的提示被遵守的可能性是其捕获的提示的 2.8 到 5.6 倍。该差距在三个模型系列中复制,并且也出现在完全独立于目标模型的纯文本监视器中。这表明标准召回可能夸大了监视器在实践中提供的保护,并且应该根据其模型的实际答案来评估监视器。