论文
弥合词汇分歧:LLM 辅助、经济高效、零样本科学实体链接
Bridging Lexical Divergence: LLM-Assisted, Cost-Efficient, Zero-shot Scientific Entity Linking
摘要
科学领域实体链接 (EL) 与一般领域 EL 不同,因为提及项和实体名称通常缺乏词汇重叠。另一个挑战是科学领域使用专门术语,这在一般领域预训练的模型中很少遇到。因此,在一般领域训练的模型很难迁移到科学领域。为了解决这个问题,域内 微调 是自然的补救措施。然而,许多科学领域缺乏专家注释的数据,这就激发了对零人工注释方法的需求。现有的零样本方法严重依赖 LLM 在整个提及语料库中生成别名,这会产生大量的计算成本,并且这些方法没有提供从 LLM 中过滤噪声的机制。为了应对这些挑战,我们提出了 Sci-ZSEL,这是一个框架,可以使用 LLM 有选择地生成实体别名以控制计算成本,并应用本体感知过滤器来删除语义上向本体邻居漂移的别名。然后,使用过滤后的别名为 微调 构建伪标记提及实体对。为了能够在低词汇重叠下评估 EL,我们还发布了一个与三个牲畜性状本体相关的新动物科学 EL 基准,其中提及项和实体表现出比现有基准低得多的词汇重叠。在五个基准测试中,Sci-ZSEL 优于非微调基准,在非重叠提及中最有用,并且将其与精选同义词相结合可在大多数设置中提供最佳性能。