论文

OntoBook:基于本体的医学编码器预训练综合教材

OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining

模型训练合成数据

摘要

我们提出了 OntoBook,一种将医学本体结构转换为编码器语言模型的预训练信号的方法。我们的方法分为三个阶段:通过本体图进行随机游走,捕获医学代码之间的层次结构和因果关系,大语言模型 将这些游走重新表述为流畅的教科书式散文,所得文本用于训练 ModernCamemBERT(一个 149M 参数的法语编码器),对同一数据有两个目标:掩码语言建模和代码对之间的关​​系预测。在三个法国医疗编码基准(FRACCO、Cantemist-FR、Distemist-FR)上,OntoBook 与仅 MLM 预训练相比取得了显着改进,FRACCO 上 +2.5 micro-F1,Distemist +8.0 micro-F1。我们发现目标之间的一致性是必要的:不一致的训练,即每个任务使用不同的数据,会导致 30 分的降级。我们发布了 130 万本 LLM 重新制定的医学教科书,涵盖三个法国本体(CIM-10、CCAM、ATC)和预训练模型检查点。