论文
Weight Oracles:用语言模型读取神经网络权重
Weight Oracles: Reading Neural Network Weights with Language Models
摘要
神经网络的可解释性方法主要是反应性的:它们分析特定前向传递过程中产生的激活,需要已知的输入来查找隐藏的功能,例如后门。我们提出了权重预言机(Weight Oracles),这是一种经过微调的语言模型,可以通过直接读取原始权重来诊断目标网络的属性,而无需进行行为测试。我们分两个阶段研究这个范式。第一阶段建立了可行性:通过分阶段的课程和外部计算链,将 无参数操作委托给确定性代码,解释器 LLM 学会根据小型Transformer的权重模拟前向传播,在未见过的目标上实现 99% 的保留准确度。第二阶段将该基础设施重新用于安全审计。我们仅使用良性病理作为训练信号来训练有关体重异常的自然语言诊断问题的预言机,并在训练不存在的后门上对其进行零样本评估。该预言机在注意力路由后门上达到了 0.93 的 AUROC,在包括隐形和对抗性正则化变体在内的多样化威胁分布上达到了 0.81。手工制作的统计检测器对它们隐含的目标威胁模型非常敏锐,但在威胁模型转变时崩溃,而预言机在各种攻击类型上仍然保持一致的能力。缩放到实际模型大小仍然是主要的开放挑战。
