论文
LatentMT:具有潜在推理的机器翻译
LatentMT: Machine Translation with Latent Reasoning
摘要
潜在推理循环语言模型 (LoopLM) 为机器翻译 (MT) 提供了不同的扩展路径:它们不是增加参数数量或发出显式的思想链标记,而是在隐藏状态内花费额外的循环计算。我们介绍 LatentMT,这是第一个针对机器翻译潜在推理 LoopLM 的系统研究。 LatentMT 采用小型 2.6B 参数骨干模型进行轻量级训练。在涵盖高、中、低资源语言的 32 个翻译方向上,LatentMT 所实现的性能可与大三到五倍的模型相媲美。它在高资源语言上具有竞争力,并且在中等资源和低资源语言上都实现了最先进的性能。研究缩放循环推理步骤数量的行为,我们发现循环计算在早期步骤中持续提高翻译质量,然后很快饱和。我们的机制分析表明,隐藏表示差异沿着循环推理步骤轴缩小,支持观察到的性能饱和。最后,我们的效率分析表明,与具有相似性能的更大的非潜在推理模型相比,LatentMT 需要更少的训练和推理计算,这使得潜在循环计算成为实现紧凑、高效和强大的机器翻译的有希望的途径。