论文

BnBERT-iPET:通过彩票剪枝的孟加拉语稀疏少样本语言建模

BnBERT-iPET: Sparse Few-Shot Language Modeling for Bengali via Lottery Ticket Pruning

摘要

深度神经网络由于其复杂的结构和大量的边,在 NLP 任务中取得了令人印象深刻的成功。使用 BERT 等大型预训练模型在自然语言处理中实现最先进的性能既昂贵又耗时,会产生大量碳足迹,并且很难在计算能力极小的机器上实现。这为训练孟加拉语等资源受限语言的复杂模型造成了障碍。然而,在复杂的神经模型中,并非所有边缘都具有同等影响力,其中一些边缘的贡献可以忽略不计。剪枝有望减少常规网络的内存占用,缩短不断增长的网络的训练时间,并在不牺牲可比性能的情况下提高推理效率。在这项工作中,我们引入了 BnBERT-iPET,这是一种针对孟加拉语的稀疏少样本语言建模方法,并通过实验表明,仅保留初始模型(如 BERT)10% 边缘的轻量级少样本学习语言模型可以在资源受限语言(如孟加拉语)的挑战性任务中与更大的模型并驾齐驱。通过迭代模式利用训练从几个镜头中学习,并使用彩票假设修剪技术实现 90% 的稀疏性,我们的修剪后的 BnBERT-iPET 模型被证明是孟加拉语标准基准数据集下游任务上最先进的语言模型(例如 Bangla Electra、Indic-BERT 和 XLM-RoBERTa)的有力竞争对手。