论文

基础模型不确定时,安全护栏模型反而过度自信

Guard Models Are Overconfident Where Base Models Are Uncertain

模型评测安全与风险评测

摘要

安全护栏模型用作安全分类器,其置信度分数驱动后续内容审核决策。我们对五个护栏模型的提示分类进行评估,发现其中几个在干净输入上接近校准,但对抗攻击会使校准恶化一个数量级,将假阴性变成与正确检测难以区分的高置信度错误。将每个护栏与其对应的基础语言模型比较后,我们发现不确定性信号往往仍然存在:在护栏失效的相同输入上,基础模型通常会表达不确定性。逐层分析将护栏与基础模型的分化定位于后层;此处护栏模型表现出更鲜明的安全与不安全分离,以及更低秩的表征,而对抗性有害输入更接近干净安全输入所在区域。这些发现揭示了遭受攻击时护栏置信度与基础模型不确定性之间的失配。