论文
BioELX:上下文感知的跨语言生物医学实体链接,无需特定任务的监督
BioELX: Context-Aware Cross-lingual Biomedical Entity Linking without Task-Specific Supervision
摘要
跨语言生物医学实体链接 (BEL) 将任何语言的提及映射到生物医学知识库中的唯一标识符,支持临床和生物医学 NLP 应用。我们确定了影响当前系统的两个问题。首先,用于训练跨语言 BEL 检索器 的 UMLS (Bodenreider,2004) 别名严重偏向英语,因此 检索器 对于非英语提及的泛化效果很差。其次,尽管上下文通常是消歧所必需的,但天真地将上下文注入仅训练用于对齐别名的 检索器 中会严重降低检索性能。我们提出了 BioELX,一个解决这两个问题的检索重新排序框架。为了进行检索,我们继续使用维基数据衍生的跨语言别名监督来训练 SapBERT_multi (Liu et al., 2021b),形成跨语言的共享概念邻域。对于重新排名,我们通过提及锚定提示将预训练的 LLM 重新排名器调整为实体链接,这标记了目标提及,以便重新排名器根据预期提及而不是上下文中的其他显着标记对候选者进行评分。实验表明,BioELX 在四个跨语言 BEL 基准测试中取得了最新的结果,将 Recall@1 比之前的最佳结果提高了 4.8 至 18.2 个百分点,并且没有任何特定于任务的 BEL 注释。我们的代码和资源可在 https://github.com/AI4MedCode/BioELX 上获取。