论文
UrduMMLU:乌尔都语语言理解的大规模多任务基准
UrduMMLU: A Massive Multitask Benchmark for Urdu Language Understanding
摘要
有意义的多语言评估必须在目标语言和教育背景下测试模型。乌尔都语有超过 2.3 亿人使用,缺乏从本土教育资源中建立的广泛的 MMLU 风格基准。我们介绍 UrduMMLU,它是跨 26 个科目和 5 个领域的 26,389 个乌尔都语 MCQ 的基准,这些基准是从本地乌尔都语 MCQ 银行和公开考试 PDF 中收集的。与基于翻译的基准不同,UrduMMLU 将学术科目与乌尔都语和地区教育的特定内容相结合。我们通过双重人工注释和严格的共识过滤来标记考试衍生部分。我们在英语和乌尔都语提示下评估了 30 个 LLM,产生了 60 个零样本评估,并在两种提示语言的多个少数样本设置下进一步评估了 4 个开源 LLM。 Gemini-3.5-Flash 表现最好,达到 90.23% 和 90.45% 的准确率,而没有其他模型超过 85%。最强的开源模型落后了 7.78 和 9.12 分,与 STEM 相比,许多模型在以乌尔都语为中心的人文学科上损失了 25 到 40 分。很少的射击提示只能产生适度的收益。 UrduMMLU 的结果表明,当前的 LLM 的乌尔都语知识参差不齐,特别是基于区域背景的内容。