论文
事实胜于雄辩:僧伽罗语到英语神经机器翻译中病理幻觉的检测
Fact over Fiction: Detection of Pathological Hallucinations in Sinhala-to-English Neural Machine Translation
摘要
神经机器翻译(NMT)模型虽然能够产生高度流畅的输出,但仍然容易产生幻觉,即自然但在语义上与源无关的翻译。这种脆弱性在僧伽罗语到英语等资源匮乏的环境中尤为严重,因为跨语言对齐较弱会导致幻觉。本文介绍了该语言对中无参考幻觉检测的框架。我们提出了一个包含 45,000 个样本的合成数据集,该数据集是通过五种语言驱动的损坏策略的概率链生成的,并具有使用字符级相似性来区分幻觉和形态变体的语义救援机制。我们对 mDeBERTa-v3 进行微调以进行标记级序列标记,在源不相交测试集上的三个种子上达到标记级 F1 0.841 +/- 0.001,并研究集成神经风险评分、序列对数概率和跨语言语义嵌入 (LaBSE) 的三信号集成。源消融控制表明探测器依赖于僧伽罗源而不是 与腐败过程的表面假象相比:改组或删除源将句子级 AUROC 从 0.970 降低到机会。我们对跨越五个模型系列的八个 NMT 系统进行了基准测试,发现探测器发射在不同架构之间存在一个数量级的差异。