论文

冻结 BERT 中的 AI 文本检测神经元:稀疏探测与激活修补

A Mechanistic Study of AI-Text Detection Neurons in Frozen BERT: Sparse Probing and Activation Patching on RAID

模型评测模型行为与机制分析

摘要

AI 生成文本检测器在标准基准上准确率较高,但推动预测的内部表示尚不清楚。本文使用 RAID 基准及涵盖基础模型和指令调优模型的六个生成器,研究冻结的 BERT-base-uncased 编码器中哪些神经元支持 AI 文本检测。研究对全部 9,216 个 CLS 隐状态维度(12 层×768,本文称为神经元)应用 Gurnee 等人(2023)的 L1 到 L2 稀疏探测流程。每个生成器都得到不足 1% 的稳定神经元,结果跨折和随机种子一致;仅使用该集合的探测器保留了大部分全特征检测准确率。双向激活修补确认其因果相关性:两个方向上,其翻转预测的频率均比同等大小随机集合高一个数量级。将这些神经元替换为均值后,准确率仍基本不变,因此信号是冗余分布的。跨生成器分析呈现两类结构:指令调优生成器的稳定神经元有 30%—36% 集中在 BERT 最后一层,两种基础生成器则均低于 14%,与后训练对齐在第 12 层留下痕迹的解释一致。留一模型家族评测显示,在未见生成器家族上,所选神经元保留全特征上限的 86%—94%;因此检测器可在小型固定子空间运行,无需对每个生成器重新识别神经元。

不同生成器对应检测神经元集合的两两Jaccard相似度;比较指令微调与基础模型组。
图5(图注摘要):不同生成器对应检测神经元集合的两两Jaccard相似度;比较指令微调与基础模型组。