通用嵌入和特定嵌入哪个更好?非英语语言临床编码搜索的实证研究
Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages
摘要
用于语义搜索的句子嵌入模型绝大多数是在英语语料库上开发和评估的。当应用于其他语言的临床检索时——特别是 ICD-10-CM / CIE-10 代码的检索——召回率的下降往往被聚合基准所掩盖。我们研究大型生成语言模型是否可以充当数据工厂来缩小这一差距。我们构建了一个两级 检索器(双编码器,然后是交叉编码器重新排序器),根据 Gemini 生成的涵盖英语、西班牙语、加泰罗尼亚语、意大利语、葡萄牙语和法语的合成数据,从西班牙语生物医学编码器 (PlanTL-GOB-ES/bsc-bio-ehr-es) 进行微调,并针对 BioBERT-ST 和未调整的西班牙语编码器进行评估。单独的双编码器在 MRR 上与 BioBERT-ST 相匹配(0.876 vs. 0.866),并且在没有英语生物医学预训练的情况下在 R@3(0.650 vs. 0.626)和 R@5(0.804 vs. 0.790)上超越它。添加跨编码器重新排序器将聚合 R@5 提升至 0.822,并在五种语言中的四种上占据主导地位(+0.017 西班牙语、+0.033 加泰罗尼亚语、+0.018 法语、+0.037 葡萄牙语),但代价是英语有少量回归。这种权衡在临床上是可以接受的:葡萄牙语达到 R@5 = 0.829,而 BioBERT-ST 为 0.714。贡献:从 LLM 生成的数据构建特定领域医疗 检索器 的开放配方;学习增益的量化(MRR 0.755 至 0.876,+15.9%,约 19,500 个合成对);以及按语言和等级描述收益集中在哪里的特征。