论文

E-CONAN(Entailment、CONtradition 和 Neutral)基准:阿拉伯语文本蕴涵和自然推理数据集

E-CONAN (Entailment, CONtradition And Neutral) Benchmarks: Arabic Textual Entailment and Natural Inference Datasets

模型评测基准与评测资源

摘要

自然语言推理处理成对的句子以提取它们的语义关系。 NLI 一直是一个热门研究课题,作为其他 NLP 应用程序的主要组件集成。尽管世界各地各种语言的文本推理都取得了显着进步,但阿拉伯语在该领域的资源仍然有限。为了解决这一差距,本文介绍了由各种来源的句子对组成的 E-CONAN 基准:(1) 自动翻译对,(2) 人工验证的机器翻译对,(3) 来自阿拉伯语作为外语教学书籍的手工制作对,以及 (4) 来自不同新闻频道的包含谣言的标题对。 E-CONAN 包含两个基准数据集:E-CONAN-2(2 路数据集(RTE))和 E-CONAN-3(3 路数据集(NLI))。此外,我们还使用 E-CONAN 基准来评估 9 个使用零样本分类的最先进的多语言预训练模型。模型在 ArNLI、XNLI 和 E-CONAN 数据集上进行了评估。结果表明,E-CONAN 是评估模型泛化甚至 微调 预训练模型的潜在有价值的资源。与 XNLI 和 ArNLI 相比,其多样化的组成源自多种来源,提供了更广泛、更稳健的评估。此外,我们还在 E-CONAN-3 数据集上评估了 5 个 LLM。此外,我们将 MARBERT 作为具有代表性的阿拉伯语特定基线,并进行性能评估比较,以展示阿拉伯语特定模型如何在 E-CONAN 基准上与跨语言和基于 LLM 的方法进行扩展。此外,我们还进行了详细的定性和定量误差分析,以分析常见的错误模式。 E-CONAN 基准将公开,我们希望它能够丰富阿拉伯语文本蕴涵和自然语言推理方面的研究社区。