论文
转导语言模型的随机估计
Stochastic Estimation of Transduced Language Models
摘要
转换语言模型(TLM)由一个预训练的 \emph{source} 语言模型和一个功能有限状态转换器组成,以在 \emph{target} 字符串上归纳出一个语言模型。计算 TLM 下目标前缀的概率相当于将换能器映射到以该前缀开头的目标字符串的所有源字符串的源模型概率相加。该集合可以是指数级大或无限大。先前的工作使用基于源前缀概率的计算快捷方式,然后通过阈值修剪波束求和来近似结果总和。这会产生一个具有未知误差的下限。相反,我们在不进行替换的情况下对源前缀进行重新采样,并通过其包含概率的倒数对每个选定的前缀进行重新加权。我们证明,递归地应用这种校正可以给出目标前缀概率的无偏估计,并让我们估计阈值修剪所损失的质量。我们的波束求和算法扩展了保留的源前缀和要保留的前缀的样本,随着更多的概率质量添加到运行估计中,减少了它们的数量。这可以节省计算量并保证运行以概率 1 停止。我们根据通过替换进行重采样的连续蒙特卡罗基线来评估百科全书文本和 DNA 的方法。它实现了更好的文本计算方差权衡,并在 DNA 上相同最大粒子数的情况下实现了更低的错误。在 DNA 到氨基酸的转导中,相对于阈值修剪波束求和,它可以将运行时间缩短几个数量级,并且使得估计长目标字符串的前缀概率变得可行。在已发表的阅读时间分析中,用无偏采样代替阈值剪枝大大降低了估计的语料库意外性,但使已发表的结论保持不变。