论文

推测解码 和多语言的诅咒

Speculative Decoding and the Curse of Multilinguality

模型推理投机采样

摘要

推测解码 是 大语言模型 (LLM) 推理的流行技术,通过使用较小的草稿模型起草多个词元来实现更快的生成。然而,推测解码 的有效性主要针对英语进行研究。受多语言诅咒的推动,我们假设由于较小模型的多语言能力有限,推测解码 对于低资源语言的效果要差得多。我们在标准 推测解码 设置下测试了 11 种语言,并为我们的假设找到了强有力的证据。接下来,我们尝试通过较大模型的 蒸馏 来提高较小草稿模型的多语言能力。然而,我们发现 蒸馏 在同一语言的任务之间泛化能力很差,并且我们认为组装一个与任务无关的、完全代表性的数据集对于低资源语言来说是不可行的。最后,我们提出较弱的 n-gram 模型作为草案模型;由于其推理成本极小,因此可以提供适度的加速。