论文

信号在哪里?医疗编码器预训练的 Web 数据配方

Where Does the Signal Live? A Web Data Recipe for Medical Encoder Pretraining

模型训练合成数据

摘要

Web 数据管理已针对解码器 大语言模型 (LLM) 预训练进行了广泛研究。相比之下,医学等密集术语领域的编码器是在小型、手动管理的语料库上进行预训练的,这限制了可扩展性和写作风格的多样性,这在非英语临床环境中是一个更加严重的瓶颈。网络规模的数据管理是否也有利于编码器在密集术语领域中的掩码语言建模(MLM)仍然是一个悬而未决的问题。为了解决这个问题,我们引入了两个互补的杠杆。医学术语密度过滤选择医学术语丰富的文档。信号放大改写使用 LLM 将文档重写为具有更广泛实体上下文的更密集变体。我们在法国医学NLP上实例化了这个食谱。医学术语密度过滤器在下游医疗任务上优于广泛使用的教育质量过滤器,两者相辅相成。单独的信号放大改写可以改善原始网络数据,将其与过滤后的网络数据混合可以产生最大的增益。该配方产生了法国医学预训练语料库 FineMed 和最先进的法国医学编码器系列 DoctoBERT,在公共基准 DrBenchmark 和专有的临床命名实体识别 (NER) 任务上进行了评估。