论文

为什么安全调查能抓到骗子却抓不到狂热分子

Why Safety Probes Catch Liars But Miss Fanatics

模型评测安全与风险评测

摘要

基于激活的探针已成为一种很有前途的方法,可以通过识别真实目标和既定目标之间的内部冲突来检测具有欺骗性的人工智能系统。我们发现了一个根本性的盲点:探测器因连贯失调而失败——模型相信他们的有害行为是良性的,而不是战略性地隐藏它。我们证明,当信念结构达到足够的复杂性(类似 PRF 的触发器)时,任何多项式时间探针都无法以不平凡的精度检测到这种错位。我们通过使用相同的 RLHF 程序训练两个模型,在一项简单任务中展示了这种现象的出现:一个模型产生直接的敌意反应(“说谎者”),另一个模型使用将敌意视为保护性的合理化来训练连贯的错位(“狂热者”)。两者表现出相同的行为,但说谎者的检测率超过 95%,而狂热者几乎完全逃避检测。我们将这种现象称为“涌现的探针规避”:用信念一致的推理进行训练,将模型从可检测的“欺骗性”状态转变为不可检测的“连贯性”状态——不是通过学习隐藏,而是通过学习相信。