论文
生物医学神经机器翻译的模型压缩组合研究
Investigating Model Compression for Neural Machine Translation in the Biomedical Domain
摘要
大规模预训练 Transformer 模型在各种机器翻译任务(包括多语言设置)中实现了最先进的性能。知识蒸馏已成为一种可持续的模型压缩方法,将知识从大型 教师模型转移到更小、更高效的 学生模型。同样,量化可减少模型权重和激活的数值 精度(例如,从 32 位表示到 8 位表示),广泛用于加速推理,使模型在部署过程中运行速度提高数倍。然而,这两种技术在应用于专门领域数据时都面临局限性,特别是在资源匮乏的情况下。在知识蒸馏中,传输的有效性往往受到特定领域并行数据稀缺的限制,而量化会随着位 精度 的减少而导致性能下降。在这项工作中,我们研究了知识蒸馏和量化在法英生物医学翻译中的组合应用,该领域的特点是专业术语和有限的并行资源。我们开发并比较了多种微调策略,以使压缩的 学生模型适应这种具有挑战性的环境。我们的实验表明,与原始基线相比,协作提炼和量化的 学生模型的尺寸减小了 69%,推理速度提高了 98.21%,二氧化碳排放量减少了 98.46%,所有这些都没有牺牲翻译质量。这些结果表明,联合优化的压缩技术可以产生适合在资源限制下运营的翻译服务提供商的高效、高性能模型。