论文
Padārtha:基于本体论的古典梵语细粒度 NER 基准
Padārtha: Ontology-Grounded Fine-Grained NER Benchmark for Classical Sanskrit
摘要
注释模式不是中立的。当应用于古典文学时,为现代新闻文本开发的标签集将源文化定义强加于它们从未设计用来描述的文本上。相反,我们以文本本身的传统为基础,引入了 \textit{Padārtha},这是第一个基于本体的细粒度命名实体识别 (NER) 梵语基准,建立在 \textit{Mahābhārata} 史诗之上。我们的标签集源自经典印度本体系统 \textit{Nyāya-Vaiśesika},产生 18 个细粒度类别,组织在 10 个本体节点下,并映射到 5 个标准粗标签,确保与现有基准的互操作性。专家注释者对命名实体学术索引中的超过 12,600 个条目进行标记,并链接到 \textit{Mahānāma} 语料库中的相应提及,为 73,632 节经文中的 108,335 个实体提及生成细粒度注释,以及采样的 5,000 节经专家验证的测试集以强调罕见的提及。我们首次针对梵文传统架构对生成 NER 进行了系统基准测试,发现经过微调的生成模型的性能与特定任务系统的性能相当。然而,所有系统都显示出从粗粒度到细粒度的急剧下降,并且与训练期间看不见的实体外提及作斗争。这种限制不仅仅是由于数据稀缺造成的,因为经过微调的模型对未见过的实体的回忆比见过的实体要差得多,并且在词汇歧义下往往会默认为多数意义。