论文
阿拉伯基准可靠吗? QIMMA 质量第一的 LLM 评估方法
Are Arabic Benchmarks Reliable? QIMMA's Quality-First Approach to LLM Evaluation
摘要
我们推出 QIMMA,这是一个有质量保证的阿拉伯语 LLM 排行榜,以系统基准验证为核心。 QIMMA 不是按原样聚合现有资源,而是应用多模型评估流程,将自动 LLM 判断与人工审核相结合,在评估前发现并解决完善的阿拉伯语基准中的系统质量问题。其结果是一个精心策划的、多领域、多任务的评估套件,包含超过 52,000 个样本,主要基于阿拉伯语内容;代码评估任务是唯一的例外,因为它们本质上与语言无关。通过 LightEval、EvalPlus 和公开发布每个样本推理输出的透明实施,使 QIMMA 成为阿拉伯语 NLP 评估的可重复且社区可扩展的基础。