论文

使用 大语言模型 进行手语翻译的目标端释义增强

Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models

模型训练合成数据

摘要

手语翻译 (SLT) 仍然受到配对手语视频/文本语料库的有限可用性以及现实世界数据集典型的重尾词汇的限制。我们研究了一种目标端增强策略,其中 大语言模型 (LLM) 生成参考口语句子的受控释义变体,同时符号输入保持不变。具体来说,我们使用 GPT-4o 生成训练目标的语义忠实变体,并在两阶段计划下训练 Signformer 风格的基于姿势的 Transformer:在增强语料库上训练 预训练,然后在原始参考文献上训练 微调。我们在三个跨越互补挑战的数据集上评估了这一策略:PHOENIX14T(德国手语),一个具有中等词汇多样性的现实世界语料库;具有高度控制、重复录音的希腊手语数据集; LSA-T(阿根廷手语),一个自然主义语料库,词汇量大,长尾稀疏。这个范围使我们能够准确地描述目标侧增强何时以及为何有益。在 PHOENIX14T 上,增强将 BLEU-4 从 9.56 提高到 10.33,这表明释义曝光有助于解码器概括超出记忆的参考短语。接近饱和的 GSL 基线和极其稀疏的 LSA-T 设置揭示了该方法的局限性:在这两种情况下,单参考词汇重叠度量不足以捕获全貌,从而激发了互补的语义评估。据我们所知,这是第一个研究 LLM 生成的目标端释义作为 SLT 增强机制的研究,也是第一个将 LLM-as-a-Judge 评估协议应用于 SLT 的研究。这种补充性评估揭示了词汇重叠指标低估的语义保真度的提高。