OncoNoteBERT:真实门诊肿瘤病历的基础表示模型
OncoNoteBERT: A Foundation Representation Model for Natural Language Processing of Real-World Outpatient Oncology Notes
摘要
真实世界的门诊肿瘤病学笔记包含专业术语、肿瘤分期表达、治疗名称、毒性描述和机构特定的去识别标记,这些标记可能无法通过一般生物医学或相邻的临床语言模型有效地表示。我们使用受监管的英国门诊肿瘤科语料库开发并评估了肿瘤学特异性 BERT 式编码器,该语料库包含来自 21,564 名接受肺癌和头颈癌治疗的患者的 290,026 份病历。我们将 RadBERT 和 PathologyBERT 与两种本地策略进行了比较:OncoNote-RadBERT(通过持续掩码语言模型预训练生成)和 OncoNoteBERT(使用肿瘤学 WordPiece 分词器从头开始训练)。使用验证集上的掩码语言建模损失和困惑度、分词器碎片指标、临床术语分词、掩码 token 探针和探索性表示分析来评估模型。两种外部编码器在零样本评估中都不太适合肿瘤学语料库(RadBERT 的困惑度为 113.04;PathologyBERT 的困惑度为 2035.03),而持续的预训练产生了最强的适合度(OncoNote-RadBERT 的困惑度为 2.10)。 OncoNoteBERT 的困惑度达到 2.83,但产生了最有效的分词,具有较低的子词拆分数量和较短的归一化序列长度。它还为 13 个 masked-token 探针中的 12 个返回了临床可接受的预测,而 OncoNote-RadBERT 为 13 个中的 7 个返回了临床可接受的预测。 语料库级别的拟合和掩码 token 表现之间的差异部分归因于分词器碎片,而不仅仅是学习的语义。两个本地开发的模型都将机构占位符表示为单个可学习的 token。这些发现表明,持续的适应和定制的分词提供了互补的好处,并且在将相邻域编码器应用于肿瘤学 NLP 之前,表示层设计很重要。
