论文
LongBEL:长上下文和文档一致的生物医学实体链接
LongBEL: Long-Context and Document-Consistent Biomedical Entity Linking
摘要
生物医学实体链接将文本提及映射到结构化知识库(例如 UMLS 或 SNOMED CT)中的概念。大多数现有系统仅使用提及或其周围的句子独立链接每个提及。这忽略了同一文档中提及之间的依赖性,并可能导致不一致的预测,特别是当相同的概念出现在不同的表面形式下时。我们引入了 LongBEL,一个文档级生成框架,它将完整文档上下文与先前预测的记忆相结合。为了使这种记忆变得强大,LongBEL 使用交叉验证的预测而不是黄金标签进行训练,从而减少训练和推理之间的不匹配并限制级联错误。对英语、法语和西班牙语五个生物医学基准的实验表明,LongBEL 比句子级生成基线有所改进,在概念在文档中频繁重复的数据集上收益最大。本地、全局和基于内存的变体的集合在所有基准测试中取得了最佳结果。进一步的分析表明,最大的收益出现在重复出现的概念上,这表明 LongBEL 主要提高了文档级的一致性,而不是孤立的提及消歧。