论文
BD-LSC 数据集:促进俚语和标准用法词汇语义变化检测模型的基准测试
The BD-LSC Dataset: Facilitating the Benchmarking of Models for Lexical Semantic Change Detection in Slang and Standard Usage
摘要
自动语义变化检测旨在识别词义如何随时间变化,提供对语言和社会变化的洞察。尽管计算词汇语义变化(LSC)最近取得了进展,但现有的基准和方法很难捕获双向语义变化,特别是单词同时获得和失去意义的情况。对于同时具有俚语和标准含义的单词来说,这个问题尤其具有挑战性。为了解决这些差距,我们引入了两个互补的基准数据集。双向词汇语义变化 (BD-LSC) 数据集捕获三个时间段内的意义增益、意义损失和稳定性,从而能够研究复杂的语义轨迹。 SlangTrack 词义消歧 (ST-WSD) 数据集为结合俚语和标准用法的单词提供细粒度的实例级语义注释,支持 WSD 和语义变化检测模型的系统基准测试。使用这些基准,我们系统地评估不同方法系列的模型:使用上下文嵌入的无监督聚类、监督机器学习、基于 Transformer 的模型和最先进的 大语言模型。在评估的系统中,few-shot GPT-4o 模型在精确意义匹配(ESM)和多标签准确性方面取得了最强的综合性能;然而,Macro-F1 在所有系统中的得分接近 0.5,表明罕见的俚语意义仍然很困难,我们将其视为核心的开放挑战。