论文
vMF Sentence LDA:句子嵌入的球形主题模型
vMF Sentence LDA: A Spherical Topic Model over Sentence Embeddings
摘要
潜在狄利克雷分配 (LDA) 及其派生模型仍然被广泛使用的主题模型。 LDA 将每个文档视为词袋,并通过词汇表的分类分布对每个主题进行建模,因此它既不使用文档的内部结构,也不使用单词之间含义的相似性。早期的工作通过两种方式应对这一限制:许多模型引入了嵌入,有些模型将主题分配给句子而不是单词。它们的组合,即观察句子嵌入的主题模型,仍然很少被探索。我们提出了 vMF Sentence LDA (vSLDA),它保留了 LDA 的混合结构,将每个句子作为其 L2 归一化嵌入进行观察,并通过 von Mises-Fisher (vMF) 分布对每个主题进行建模,该分布与句子嵌入的余弦几何形状相匹配。它的每个主题参数计数和每次迭代成本在嵌入维度中是线性的,而现有模型中句子嵌入的全协方差高斯分布是二次的。我们评估 vSLDA,其中限制预计最重要,在共享大量词汇的主题中:细分集合中一个主题的主题,以及当语料库被划分为大量主题时产生的狭窄主题。在两个语料库上,当从文档主题分布中对每个粗类别内的精细类别进行分类时,vSLDA 相对于八个基线获得了最佳平均排名。总体来看,语料库的优势随着主题数量的增加而显现或扩大。通过主题后验对每个句子的词频进行加权,会产生与 LDA 形式相同的预期主题词计数,因此标准主题连贯性和多样性度量适用于将主题分配给句子的模型。在产品、主题质量方面,vSLDA 在语料库的大多数类别内条件中处于领先地位。