论文
用于药物重新定位候选药物实际筛选的预训练医学表征
Pretrained Medical Representations for the Practical Screening of Drug Repositioning Candidates
摘要
从电子健康记录和医疗索赔数据中的医疗代码序列进行表示学习已在各种临床应用中取得成功,例如有关疾病预测的应用。然而,将这种方法扩展到科学假设的发现方面仍然存在重大挑战。原因之一是许多现有的基于 BERT 的模型无法充分捕捉医疗代码的层次结构以及诊断和治疗之间复杂的相互作用。为了解决这些限制,我们提出了一种新的统一预训练框架,该框架显式集成了分层子词元聚合、部分屏蔽和交叉引用机制。所提出的模型在预训练目标和下游临床事件预测任务(包括痴呆症的发作和住院治疗)方面始终优于现有方法。我们还进行了一项针对阿尔茨海默病的计算机药物重新定位案例研究。在假设生成步骤中,我们的方法以数据驱动的方式成功地重新发现了已知的有前途的药物,而不依赖于文献等外部知识源。随后,在假设优先级划分步骤中,我们引入了一种任务自适应表示方法,以减轻诊断向量中历史处方信息的过度编码,从而能够对生成的假设进行稳健的优先级划分。本研究建立了一个探索性筛选工作流程,用于基于观察关联的假设生成和优先级排序。重要的是,该框架并不是为了提供因果证据,而是为了识别有希望的候选者以进行后续严格的因果推理。总的来说,这项研究表明,领域知情表示学习与任务自适应表示控制相结合可以实现实用的假设发现工作流程。