论文
平均池化为何有效:量化文本嵌入的二阶信息坍缩
Why Mean Pooling Works: Quantifying Second-Order Collapse in Text Embeddings
摘要
为了构建文本嵌入,平均池化(平均标记嵌入)是标准方法。本文研究了平均池化化在真实模型中是否确实有效。首先,我们注意到平均池化可以折叠词元嵌入的一阶统计数据之外的信息,例如捕获其空间结构的二阶统计数据,可能将不同的词元嵌入分布映射到类似的文本嵌入。出于这种担忧,我们提出了一个简单的指标来量化平均池化引起的这种崩溃。然后,使用这个指标,我们凭经验测量这种崩溃在实际模型和文本中发生的频率,并发现现代文本编码器对这种崩溃具有鲁棒性。特别是,对比微调的文本编码器往往比预训练的骨干模型更不容易崩溃。我们还发现这些文本编码器的鲁棒性在于每个文本中标记嵌入的集中度。此外,我们发现,通过我们提出的指标量化的崩溃鲁棒性与下游任务性能相关。总的来说,我们的研究结果为为什么现代文本编码器尽管依赖于看似粗略的平均池化仍然有效提供了一个新的视角。