论文

AraSSM:用于阿拉伯掩码语言建模的双向状态空间编码器

AraSSM: A bidirectional state-space encoder for Arabic masked language modeling

模型训练预训练

摘要

预训练的 Transformer 编码器(例如 AraBERT、MARBERT 和 CAMeLBERT)已成为阿拉伯语自然语言理解的标准骨干,但它们的自注意力机制随序列长度呈二次方扩展,这限制了长文档的效率。 Mamba 是一种选择性状态空间模型 (SSM),提供线性时间序列建模作为注意力的竞争替代方案,但目前还没有专门针对阿拉伯语进行预训练的专用双向 Mamba 编码器。我们推出了 AraSSM,这是一种双向 Mamba 编码器,通过在结合阿拉伯语维基百科和 CulturaX 文本的语料库上进行掩码语言建模进行预训练,并在四个消费级 NVIDIA RTX 2080Ti GPU (11GB) 上进行端到端训练,历时大约十天。我们遵循 AraBERT 引入的每任务评估协议,在四个已建立的阿拉伯语 NLU 基准上评估 微调 的 AraSSM,涵盖情感分类 (HARD)、命名实体识别 (ANERcorp)、提取式问答 (ARCD) 和自然语言推理 (XNLI-ar),并将结果报告为三个 微调 种子的平均值 +/- 标准差。 AraSSM 在情感分类方面匹配或超过已发布的基本大小 Transformer 基线(HARD 上的准确度为 96.37 +/- 0.03%),在提取 QA(ARCD 上为 32.19 +/- 1.07 EM、63.79 +/- 0.25 F1)和命名实体识别(ANERcorp 上为 81.54 +/- 0.30 实体级 F1)方面具有竞争力,并且尽管在消费类硬件而不是大规模加速器集群上完全从头开始训练,但在自然语言推理方面落后于基本大小的 Transformer 范围(XNLI-ar 上的准确度为 72.83 +/- 0.07%)。