论文荷兰医学领域语言语料库Language corpora for the Dutch medical domainB. van Es·来源日期:2026.04.28模型训练合成数据收藏摘要原文译文背景:荷兰医学语料库稀缺,限制了 NLP 的发展。方法:我们翻译了英语数据集,识别了通用语料库中的医学文本,并提取了开放的荷兰医学资源。结果:生成的语料库包含医疗领域约 1.05 亿份文档中的 +- 360 亿个标记,可在 Hugging Face 上免费获取。结论:这项工作为 预训练 和下游 NLP 任务建立了第一个大规模荷兰医学语言语料库。