论文
Transformer 中用于语言建模的变分神经元
Variational Neurons in Transformers for Language Modeling
摘要
Transformer 的语言建模通常依赖于确定性的内部计算,不确定性主要表现在输出层。我们将变分神经元引入 Transformer 前馈计算中,以便不确定性成为内部计算本身的一部分。具体来说,我们用基于 EVE 的局部变分单元替换确定性前馈单元,同时保留整体 Transformer 主干。我们在紧凑的下一个词元语言建模设置中评估这种设计。我们将确定性变量和变分变量与预测性和概率性标准进行比较。除了负对数似然、困惑度和准确性之外,我们还分析校准、条件方差、互信息和潜在使用统计数据。生成的图片很清晰。变异神经元稳定地整合到 Transformer 中,保持强大的预测性能并产生信息丰富的不确定性信号。实验还表明,任务质量、有用深度和内部稳定性是不同的属性。这些结果将变分 Transformer 确立为不确定性感知语言建模的实用形式。他们表明,Transformer 可以通过明确的内部不确定性结构进行预测,这支持更强的概率评估和对模型行为进行更丰富的分析。