论文
通过积极修剪专家从 LLM 中提取小型翻译专家
Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts
摘要
现代 大语言模型 (LLM) 实现了最先进的机器翻译性能,但它们是作为广泛的通才来实现的,这些通才主要接受了与翻译无关的许多任务和功能的训练。因此,它们针对此任务严重过度参数化,导致内存和计算需求过多。在本文中,我们提出了一种从现代专家混合体 LLM 中积极修剪专家的方法,同时翻译质量的下降可以忽略不计。我们的方法利用 LLM 中的专家专业化和多语言功能的可分离性来识别与翻译无关的专家。由于 MoE 的模块化特性,无需任何训练即可轻松修剪它们。如果不进行再训练,我们就能够修剪掉一半的专家,而降级可以忽略不计,而 70% 的专家则只有很小的损失。通过非常短的 SFT,我们在恢复基线性能的同时删除了 75% 的专家,并且在某些设置中删除了近 90%,同时保持了合理的翻译质量。总体而言,我们的结果表明,翻译仅需要 LLM 的一小部分,从而能够对包含超过 90% 参数的 MoE 块进行大幅压缩。