论文

阿拉伯语语言处理小语言模型的评估

Evaluation of Small Language Models for Arabic Language Processing

模型评测基准与评测资源

摘要

本文评估了 12 个小语言模型 (SLM) 在阿拉伯语自然语言处理任务上的性能。该研究引入了涵盖 8 个领域和 10 种语言技能的 240 个阿拉伯语测试项目的基准,涵盖面向理解和面向生成的任务。所有模型均使用标准化的仅阿拉伯语提示模板在受控的零样本设置下进行评估。通过涉及 GPT-4.1 Mini、Claude Haiku 4.5 和 DeepSeek-Chat 的多模型 LLM-as-a-judge 框架评估模型反应,并根据任务、技能和模型系列对各个法官的分数进行汇总并进行分析。结果显示,Gemma 3 (12B) 获得了最高的总分 (4.548/5),其次是 Aya 和 C4AI Command Abroad。观察到的结果表明,模型大小本身并不能解释阿拉伯语 SLM 的性能。具有更强的阿拉伯语对齐和更可靠的指令遵循行为的模型往往在任务中表现更好。性能较低的模型中常见的失败模式包括即时泄漏、幻觉、语言漂移、生成不完整和任务依从性差。总体而言,该基准为评估紧凑的阿拉伯语言模型提供了结构化的参考,并支持未来高效、可靠和文化适宜的阿拉伯人工智能系统的工作。