论文

激活预言机的置信度和校准,以实现语言模型内部的可靠解释

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

模型评测评测方法与指标

摘要

激活预言机是一种语言模型,经过训练可以读取另一个模型的内部激活并用自然语言描述它们,例如命名另一个模型被训练隐藏的秘密单词。 Oracle 的答案没有任何可信度,这限制了它们在审计中的使用。我们比较了在这个秘密单词任务中将置信度分数附加到预言机答案的五种方法,涉及两个模型系列(Qwen 和 Gemma,8B 到 27B 参数)的四个预言机,每个方法和预言机的样本为 6,000 。这五种方法在所有四种预言机上的排名方式相同。使用哪种方法取决于一个问题:审核员能否提前列出可能的答案?如果审计员可以,那么让预言机对每个候选人的答案进行评分,准确率大约会提高一倍,并将正确答案与错误答案区分开来,最好是五个答案(AUROC 0.92 到 0.96 )。如果预言机必须自由生成答案并且不存在标记数据,则二十个样本的一致性率是在每个预言机上校准的唯一置信度。一旦存在标记数据,重新调整的答案概率就会在一代而不是二十代达到相同的校准。要求预言机给出置信度,在任何预言机上都没有给出可用的信号。代码和修补的训练器可在 https://github.com/federicotorrielli/probabilistic_activation_oracles 上找到。