论文

ClinicalAligner26AM:用于数据集翻译的跨语言对齐器;来自 MultiClinCorpus 共享任务的证据

ClinicalAligner26AM: A Cross-Lingual Aligner for Dataset Translation; Evidences from the MultiClinCorpus Shared Task

应用与实践机器翻译

摘要

词级跨语言对齐是注释投影、翻译审核和跨语言 忠实性 估计的核心,但现有的神经对齐器很少适用于专门领域。在本文中,我们介绍了 ClinicalAligner26AM,这是一种从 ClinicalEncoder26AM 初始化的生物医学和临床文本的大上下文多语言对齐器模型。我们的训练配方的灵感来自 AWESoME Align。我们通过融合句子级、短语级和 词元级 信号,使用 Sinkhorn-Knop 最佳传输锐化为并行临床文本和对话建立的成本矩阵,从而构建软对齐目标。我们通过鼓励其基于余弦的词元相似度分数来匹配该目标,将这个锐化的对齐矩阵直接提取到我们的学生对齐器中。在推理时,我们通过学习的标记对齐矩阵来投影源跨度分数,并解码目标文本中最长的有效高分跨度,可选地由附录 B 中总结的 MultiClinNER 预测支持。我们在 MultiClinCorpus 共享任务上评估 CA26AM,该任务将西班牙语临床实体注释投影为六种目标语言。我们提交的两个系统在所有语言和实体类型中分别排名第一和第二,几乎在所有设置中字符加权 F1 分数都高于 0.95。