论文

寻找语言模型中识别网络地址的头与神经元

Finding the Heads and the Neurons Responsible for Network Information Retrieval in Language Models

模型评测模型行为与机制分析

摘要

我们询问特定的注意力头以及这些头内更精细的特定神经元是否负责识别语言模型的上下文包含网络基础设施信息(与其 IP 地址配对的主机名),以及是否可以通过因果关系而不是仅通过相关性来验证该责任。在头部级别,答案是肯定的,跨越三个架构系列的五个模型:在每个模型中,通过因果 消融 筛选发现的一小组头部(128 到 1152 个候选者中的 1 到 9 个)并测试了针对匹配的阴性和上下文无关控制的选择性,支持具有 99.5--100\% 保留测试 准确度的检测器。然后我们问,头部的责任是否集中在一个神经元中,还是分散在其各个维度上?这是特定于模型的。在一个模型中,顶部头部的信号集中到单个神经元中,该神经元是通过因果干预和相关排名独立发现的,两者完全一致(AUC = 1.000,与整个头部匹配)。在另一个例子中,单个干净的头部作为一个整体工作(AUC = 1.000),但其中因果排列最好的神经元则不然(AUC = 0.665),因此责任分散在整个头部。其余三个型号介于两者之间。在不同机构收集的独立数据集(反向 DNS 记录而不是发现数据)上,每个模型的全头检测器都会标记 100% 的阳性记录;单神经元版本的传输可靠性较差,并且在一个模型中得分低于 随机水平。对特定网络信息实体的因果头查找可以跨模型和架构进行;这一发现可以在多大程度上推广到各个神经元,并且需要针对每个模型进行检查。