论文

开放权重语言模型中评估意识的表征深度随着规模的变化而变化

Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models

模型评测模型行为与机制分析

摘要

语言模型知道它们何时被测试吗?这个问题对于人工智能安全至关重要:识别评估环境的模型可能会战略性地改变其行为,从而使下游基准更难解释。使用涵盖 Qwen 2.5、Gemma 2 和 Llama 3.2 的 11 个模型,我们发现表征深度存在系统性的依赖于大小的转变:在 Qwen 2.5 和 Gemma 2 中,评估意识最线性可恢复的层从较小模型中的后期层移动到较大模型中的早期层。这表明规模不仅改变评估意识的强度,而且改变网络中最线性可恢复的位置。这种深度转变有助于解释为什么族内尺度轨迹是非单调或逆的,而不是平滑和族通用的,这表明在更密集的族内采样下不支持简单的通用幂律解释。最后,白盒探针信号始终强于黑盒行为表达,并且两者之间的关系因家族而异,其方式无法仅由探针 AUROC 预测。