论文
基于编码器的语言模型中作者身份信号出现在哪里?
Where Does Authorship Signal Emerge in Encoder-Based Language Models?
摘要
使用相同的预训练编码器、数据和损失进行微调的作者归因模型的性能可能会相差四倍,仅取决于其评分机制。我们使用机械解释工具来解释这一差距。我们探测的每个模型的每一层都具有类似的文体特征,例如字长、标点符号密度和功能词频率,包括现成的控制编码器,这表明这种差距不能用它们的线性可读性来解释。相反,因果干预表明评分器似乎可以确定编码器在何处整合作者信号。平均池化迫使早期到中间层进行整合,而后期交互则将其推迟到后面的层。我们进一步从每个评分器的梯度结构中得出这种差异,并且训练动态揭示了从这种差异中得出的不同学习轨迹。