论文
E-CONAN:面向阿拉伯语蕴涵、矛盾和中立判断的语言现象诊断数据集
E-CONAN (Entailment, CONtradition And Neutral) Diagnostics Dataset Investigating Linguistic Phenomena in Arabic Natural Language Understanding
摘要
自然语言理解(NLU)在各种应用中发挥着至关重要的作用,但其性能在处理人类语言的复杂性(从词汇歧义到高级推理困难)方面存在弱点。分析不同语言现象中的错误对于 NLU 的改进至关重要,因为它将帮助人类获得洞察力,全面评估模型的局限性和能力,从而优化模型的泛化能力。值得注意的是,一些基准测试包含专为调查和细粒度错误分析而设计的诊断数据集。在强调最先进技术的差距时,我们注意到没有宏观和微观类别的命名约定,甚至没有应该涵盖的语言现象的标准集。为了克服这一差距,我们提出了跨语言 NLU 错误分析的初始层次结构。此外,我们提出了一种创建 NLI 分层框架的方法,并对阿拉伯语 NLU 进行了案例研究。此外,本文还介绍了 E-CONAN 诊断数据集,这是一个免费可用的数据集,根据我们提出的阿拉伯层次结构手动注释了粗粒度和细粒度类别。 E-CONAN 数据集通过进行错误分析和深入调查,帮助 NLU 设计人员更好地理解他们的模型。我们使用 E-CONAN 研究了 9 个预训练语言模型和 5 个LLM的性能。结果表明,LLM 在世界知识和常识推理宏观类别中优于预训练模型,但在句法宏观类别中表现不佳。此外,所有模型最难的现象是推理,所有预训练模型最简单的现象是句法,LLM最简单的是词汇句法。