论文
作为约束文本生成的跨语言临床注释投影:六种语言研究
Cross-Lingual Clinical Annotation Projection as Constrained Text Generation: A Six-Language Study
摘要
背景:确定跨语言临床注释投影是否可以制定为文本保存的文档级生成任务,为多语言临床语料库构建生成可验证的字符级注释,并表征其相对于基于候选的投影管道的鲁棒性和计算权衡。方法:我们开发了一种受约束的 LLM 投影工作流程,将实体标签直接插入不可变的目标语言文本中,然后进行确定性验证和字符偏移重建。我们将其与监督候选跨度投影和混合 ML-LLM 细化一起进行评估,以将西班牙疾病、症状和程序注释转换为六种语言。评估使用 MultiClinAI 人工标准,具有严格的跨度匹配和字符重叠 F1 结果:直接 LLM 投影实现了最强和最一致的性能。 GLM 5.2 在 18 种语言-实体组合中获得的平均 Strict F1 为 0.9201,而本地部署的 Gemma4:31B 则达到 0.9133。最好的 LLM 配置在所有 18 个设置中将 Strict F1 比之前最先进的技术提高了 0.0564-0.1512,产生了 55,416 个带有重建偏移的在原文定位的实体提及。结论:基于 LLM 的直接投影可以实现高质量的多语言临床注释传输,并提供了一种实用方法,可以将临床 NLP 资源扩展到具有较少注释数据集和特定于语言的工具的语言。结合局部推理和确定性验证,可以大大减少多语言临床语料库构建的专家时间和成本。