论文

开源权重掩码内省:测量语言模型能就自身计算报告什么

Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation

模型评测模型行为与机制分析

摘要

前沿模型能够对其内部状态进行内省吗?近期工作提示,在某些条件下,一个足够复杂的模型可以审计自己的内部、指出什么发生了变化,并自信地报告。我们在来自七个家族的八个开源权重模型上检验了这一主张,没有发现这种能力:当被问及自己的计算是否被改动时,没有一个模型的回答优于随机水平。为检验它,我们构建了开源权重掩码内省(OWMI)框架,该框架对残差流位点、注意力头和稀疏自编码器特征进行干预,然后对照答案必须击败的零条件询问模型这一变化:什么都没被改动的虚假运行、影响匹配的随机扰动,以及只看可见输出的纯文本观察者。在超过78,000次测量中,没有任何模型的报告能超越随机水平地区分真实干预与虚假运行(AUROC ~0.5007),且等价性检验把效应限定在0.15个AUROC百分点以下。令人惊讶的是,所有需要的信息都在模型之中。一个被微调来报告这类干预的模型在留出方向上达到近乎完美的恢复,而一个线性探针能从同样的激活中以75%到95.8%的准确率恢复干预的存在,并在模型说话前的最后一层锐化为零留出误差。在一个模型中,信号浮现在置信度而非文字上:其是否回答从不变化,而附着其上的置信度以0.647的AUROC区分干预与虚假运行。失败位于从内部状态到言语报告的通路中,因此读取模型自身证词的监督需要对照内部参照加以验证。虽然我们的结果表明当前开源权重模型不能内省,但对未来模型而言这一争论尚未尘埃落定。