论文
语言模型中的评估意识:表示、语言化和控制
Evaluation Awareness in Language Models: Representation, Verbalization, and Control
摘要
能力和安全基准都基于这样的假设:接受测试的语言模型的行为可以提供有关其部署行为的信息。如果模型推断它们正在被评估并根据这种背景调整它们的响应,那么这种假设可能会失败。这种被称为“评估意识”的假设已在前沿和开放权重语言模型中得到观察。我们通过对六种语言模型(来自四个家族和三种规模)和三个指标进行探索,对这种现象进行了系统的研究。更准确地说,我们检查(i)评估是否在模型的激活空间中线性表示,(ii)它在它们的输出标记中被语言化(由 LLM 作为法官评分),以及(iii)转向因果影响它们的行为。对于开放检查点 Olmo 模型,我们在每个训练阶段进一步测试这些措施。在此过程中,我们报告评估意识可以从每个模型的残余流中线性解码(最佳 AUROC $\geq 0.7$)。相比之下,这些表示仅部分与语言表达一致:它们的相关性和相互信息在某些设置中不为零,但在模型、层和读出选择之间存在很大差异。然而,沿着探针导出的方向进行转向可以改变言语得分。最后,对 Olmo 检查点的比较表明,评估意识已经存在于基础模型中,在监督 微调 的整个阶段中得到放大,并在此后保持稳定——与转向的效果不同,转向的效果在每个连续的训练阶段都变得更加明显。这些结果表明,需要进行评估来解释模型内部代表的内容、它们所表达的内容以及它们的指导之间的脱节。