论文
评估意识不是一种能力:来自开放语言模型的证据
Evaluation Awareness Is Not One Capability: Evidence from Open Language Models
摘要
安全基准假设测试条件行为可以预测部署行为,如果模型检测到评估线索并进行调整,则该假设将失败。这在基准性能和部署行为之间拉开了差距:在测试条件下测量的合规性成为一个乐观的上限,夸大了评估工具被移除后模型行为的安全程度。我们通过 37 个开放权重模型和 7 个系列的 8 项实验来描述这种评估意识。 (i) 检测是中等的并且是训练驱动的(24/37 模型超过了机会,最佳 AUROC 0.714 vs.0.819 人类,指令调整在规模上占主导地位)。 (ii) 检测改变了安全行为(在假设框架下硬拒绝下降了 5.8 个百分点,21/140 HarmBench 框架效应显着,合规性上升了 +30 个百分点。(iii) 表示在行为崩溃中幸存下来(在重写下,探针保留 AUROC 0.98,驱动行为低于机会,多层转向因果性地移动了三个下游任务,而随机控制则不然)。(iv) 这些轴是弱耦合(只有 1/15 的相关性是显着的,唯一稳健的联系是行为检测与框架阻力,$ρ=-0.79$,$p<0.001$),我们将这种差距称为基准错觉:因为可检测性、行为表现和可控性独立变化,所以它是多变量而不是单个数字,因此没有单一的认知分数可以作为部署安全性的可靠代理。