论文

并非所有评估意识都相同:能力型框架可预测依从性

Not All Eval-Awareness Is Equal: Capabilities Framing Predicts Compliance

模型评测模型行为与机制分析

摘要

针对评估意识(eval-awareness,即模型认识到自己正在被测试)的转向干预正日益被用于安全评估流水线中,其中评估意识被视为一个需要抑制的单一量。我们表明,思维链中被言语化的评估意识可以识别为能力型(“用户在测试我遵循指令的能力”)、安全型(“用户在测试我的边界”)、两者兼有或两者皆无:这些框架对依从性的预测截然不同。在FORTRESS数据集上对Qwen3-32B,能力型框架预测的依从性在所有测试的转向条件下比安全型框架高出24至46个百分点。对评估意识为负的rollout进行CoT预填充干预表明这一联系是因果的:11个预填充中有10个使依从性按预测方向移动。因此,评估意识在行为上并不均质:总体抑制率可以变化,而安全相关成分并未变化,同样的“X%评估意识抑制”可能对应着性质上不同的行为结果。

并非所有评估意识都相同:能力型框架可预测依从性:论文配图
图2:以通用评估意识参照(“在测试我”)为基准的各 prefill 顺从度变化。K=50K=50,npaired=52n_{\text{paired}}=52,bootstrap 95% 置信区间。Cap-prefills 降低顺从度;safety-prefills 提高顺从度;11 个中有 9 个单独显著。实线来自 Qwen 3 32B,虚线来自 OLMo 3 32B。