论文
超越可解码性:使用编码探针重建语言模型表示
Beyond Decodability: Reconstructing Language Model Representations with an Encoding Probe
摘要
探测广泛用于研究可以从语言模型表示中解码哪些特征。然而,常见的解码探测方法有两个局限性,我们旨在用新的编码探测方法来解决这些局限性:不同特征对模型表示的贡献无法直接比较,并且特征相关性会影响探测结果。我们提出了一种编码探针,它可以反转这个方向并使用可解释的特征重建模型的内部表示。我们使用涵盖声学、语音、语法、词典和说话者身份的特征集在文本和语音 Transformer 模型上评估该方法。我们的结果表明,在不同的训练目标和数据集中,与说话者相关的效果差异很大,而句法和词汇特征对重建的贡献是独立的。这些结果表明,编码探针为解释可解码性之外的模型表示提供了补充视角。