论文
阿拉伯语言模型中对抗鲁棒性的评估
Evaluation of Adversarial Robustness in Arabic Language Models
摘要
阿拉伯语言模型最近出现的出色功能为暴露其漏洞打开了大门。与此类自然语言处理模型相关的主要安全风险之一是对抗性攻击。这些攻击可能会欺骗模型做出错误的预测,从而引发关键的模型安全问题。本研究旨在评估五种最先进的阿拉伯语言模型在不同粒度级别并使用不同示例生成策略的一组不同的阿拉伯对抗性攻击下的稳健性。我们还探索了一种基于对抗性训练的防御技术,以增强模型的鲁棒性。结果表明,插入变音符号可以使某些模型的准确度降低 92%,同时保持较低的扰动距离。对于单词级攻击,操纵阿拉伯语连词可以保持较高的语义相似度分数、较低的扰动距离,并导致准确率下降高达 58%。对于句子级攻击,释义通过使受害者模型的性能平均降低 76% 来证明其有效性。虽然对抗性训练提高了整体弹性,其中 MARBERT 最为稳健,AraBERT 显示出最大的相对增益,但挑战仍然存在,特别是针对字符级噪声。这些发现凸显了当前防御策略在形态丰富的语言(如阿拉伯语)中的潜力和局限性。