论文

TailNLG:解决长尾实体语言化的多语言基准

TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities

模型评测基准与评测资源

摘要

结构化知识的自动语言化是使非专家用户可以访问知识图并支持检索增强生成系统的关键任务。尽管数据到文本生成的最新进展提高了多语言覆盖率,但很少有人关注罕见实体(通常称为长尾实体)的语言表达中的潜在偏差。在这项工作中,我们首次对数据到文本生成中的长尾实体进行系统研究。我们推出了 TailNLG,这是一种新的英语、意大利语和西班牙语多语言基准,基于维基数据构建,涵盖不同受欢迎程度的实体。我们在零样本设置下评估了 大语言模型 的三个不同系列,并比较了它们在罕见实体和常见实体上的性能,以及与已建立的 WebNLG 基准的性能。我们的结果揭示了对长尾实体的一致偏见:基于嵌入的分数较低,而稀有实体的模型不确定性较高。我们进一步表明,长尾实体的影响因模型和语言的不同而不同,并且现有的评估指标并不能始终如一地捕捉这些差异,这凸显了对更可靠的评估框架的需求。