论文
超越 BLEU:重新定义手语翻译基准的案例
Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks
摘要
BLEU-4 是评估手语翻译 (SLT) 的标准指标,但口语指标可能无法充分反映手语熟练程度。 SLT 的多模态、低资源环境允许模型利用虚假相关性和口语先验,而不是学习更强的符号表示。在本文中,我们评估了 Phoenix-2014T 和 CSL-Daily 上六个 SLT 模型的时空理解与 BLEU-4 之间的关系,表明 BLEU-4 的进步本身并不是更好的手语理解的证据。这项工作引入了一种受语言学习评估启发的替代方案,使用开放权重 LLM QA 协议来测量显着内容的保留。它与人类排名更加一致,并且释义不变性比 BLEU-4 高六到七倍。应用于 SLT 时,该协议以内容传输为目标,对训练测试重叠更加稳健,并给出了该领域的不同图景:Phoenix-2014T 上的五个无光泽系统在很大程度上彼此处于噪声范围内,而光泽监督系统则高出 9.3 个点,这一差距对于 BLEU-4 来说是看不见的。