论文
Mizan:评估伊拉克阿拉伯语和伊拉克公民语境大型语言模型的国家基准
Mizan: A National Benchmark for Evaluating Large Language Models on Iraqi Arabic and the Iraqi Civic Context
摘要
阿拉伯语大语言模型 (LLM) 评估围绕现代标准阿拉伯语 (MSA) 已经成熟:开放阿拉伯语 LLM 排行榜 (OALL)、HELM 阿拉伯语和 BALSAM 等聚合排行榜对数十个 MSA 任务中的模型进行排名,前沿系统日益饱和。伊拉克人实际使用的阿拉伯语方言对于这一基础设施来说几乎是看不见的。我们介绍 Mizan(“平衡”),这是伊拉克评估伊拉克阿拉伯语和伊拉克公民背景的大语言模型的国家基准:MSA 基线轨道与跨六个轴(方言理解、方言生成、双向 MSA-伊拉克翻译、伊拉克特定知识、官方文档字段提取和安全)的伊拉克轨道配对,由 340 个最初撰写、双重审查的项目组成,每个已发布分数上都有经过统计审核的答案位置和威尔逊区间。对 27 个系统进行了试点评估,涵盖发布三天后的封闭边界模型、跨规模级别的开放权重以及商业、开放专业和主权系统的阿拉伯三重奏,得出了四项发现。 MSA 赛道已经饱和,而伊拉克赛道则存在歧视,每个模型始终存在 14-18 分的差距,并且统计上并列领先。官方文档提取将每个系统限制为 32-56。以阿拉伯语为重点的专业化表现与 MSA 专业化一样:两个专门的阿拉伯语模型在伊拉克赛道上的得分低于尺寸匹配的通才。最新型号系列的安全强化层明确拒绝无害的方言理解项目,将其视为违反政策,这是 MSA 基准测试中看不到的过度拒绝模式。该平台强制执行不可变快照、验证证书、人工发布门和公共撤回的完整性协议,所有这些都在本研究期间执行。代码和公共开发集随本文一起提供。