论文
超越单一参考:手语翻译中的改述训练与评估
Beyond a Single Reference: Training and Evaluation with Paraphrases in Sign Language Translation
摘要
大多数手语翻译(SLT)语料将每个手语话语与单一书面语言参考配对,尽管手语与口语之间高度非同构,多种翻译都可能同样有效。这一局限同时制约模型训练和评估,尤其是BLEU等基于n-gram的指标。在这项工作中,我们研究使用大语言模型自动生成书面语翻译的改述变体,作为SLT的合成替代参考。首先,我们使用适配的ParaScore指标比较多种改述策略和模型。其次,我们研究改述对基于姿态的T5模型在YouTubeASL和How2Sign数据集上训练和评估的影响。我们的结果表明,在训练中简单纳入改述并不能提升翻译性能,甚至可能有害。相反,在评估中使用改述能带来更高的自动分数,并与人类判断更好地对齐。为形式化这一观察,我们提出BLEUpara,BLEU的扩展,针对多个改述参考评估翻译。人类评估确认BLEUpara与感知翻译质量的相关性更强。我们发布所有生成的改述、生成和评估代码,以支持SLT系统可复现且更可靠的评估。
