论文
当上下文翻转时,安全即失效:诊断对齐语言模型中的脆弱安全性
When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models
摘要
安全基准分数不足以证明已具备部署条件:对齐后的语言模型即使面临翻转了哪个动作是安全的情境更新,仍常僵化地遵守原有规则。我们将这种失效称为脆弱安全(brittle safety)。为诊断该问题,我们引入上下文翻转评估,在一个安全基准(PacifAIst)和两个常识对照上测试12个模型,使用名义上安全的动作会产生伤害的成对变体。由此得出三项发现。第一,脆弱安全是安全特异性的:全部12个模型都表现出安全-常识差距(平均+17.4个百分点)。基线准确率无法预测脆弱程度:在基线准确率超过90%的模型中,脆弱率从13.7%到90.0%不等。第二,失效源于策略覆盖而非理解错误:尽管模型在每一例中都承认了上下文变化,它们仍通过三种不同的机制坚持原行为,这些机制随更新类型和模型家族而变化。第三,在人工审核的灾难性后果翻转场景探针上,标准的动作级护栏一个也未能拦截,而状态感知验证器全部拦截,且对正确干预无误报。这表明动作级内容审核对后果翻转存在系统性盲区,从而催生了对状态感知架构替代方案的需求。我们发布了评估协议、扰动基准和部署探针。
