论文
用于多词元预测的 Self-蒸馏
Self-Distillation for Multi-Token Prediction
摘要
随着大语言模型(LLM)规模的扩大,推理效率成为关键瓶颈。多词元预测 (MTP) 可以通过并行预测多个未来词元来加速 LLM 推理。然而,现有的MTP方法仍然面临两个挑战:MTP头的接受率有限,以及联合训练多个MTP头的困难。因此,我们提出MTP-D,一种简单而有效的自蒸馏方法,以最小的额外训练成本,提高MTP头接受率(+ 7.5 \%),同时最大限度地保持主头性能。我们还为 MTP-D 引入了循环扩展策略,实现了有效且经济的 MTP 头扩展,并进一步显着提高了 1 头 MTP 的推理速度 (+220.4\%)。此外,我们通过对七个基准的广泛实验,系统地探索和验证了 蒸馏 策略的关键见解以及 MTP 的潜在可扩展性。这些结果表明,我们的MTP-D和循环扩展策略有效地提高了MTP-head的性能和推理效率,促进了MTP在LLM中的实际使用。