论文
DualAnchor:在无光泽手语翻译中保留语言先验并提高词汇保真度
DualAnchor: Preserving Language Priors and Improving Lexical Fidelity in Gloss-Free Sign Language Translation
摘要
大语言模型 (LLM) 的最新进展导致手语翻译 (SLT)(将手语视频转换为口语文本的任务)越来越多地采用 LLM 作为文本主干。然而,尽管具有强大的语言建模能力,现有的基于 LLM 的 SLT 方法通常会先破坏而不是利用这种语言,从而产生不流畅的翻译,我们将这种失败称为语言先行退化。同时,现有方法通常在句子级别对齐视频和文本,这不能确保准确的词汇细节并造成词汇保真度差距。为了解决这两个问题,我们提出了 DualAnchor,这是一个基于 LLM 的无光泽 SLT 训练框架,它结合了两个互补的锚点,以实现语言流畅和视觉忠实的生成。 词元级 先验锚定(TPA)通过在每个解码步骤对多模态解码器进行正则化来保留 LLM 的语言先验,以实现以相同自回归前缀为条件的冻结 LLM 的下一个词元分布。最佳传输对齐 (OTA) 通过将视觉文本匹配制定为熵正则化部分最优传输来提高词汇保真度,并使用 Sinkhorn 优化在余弦成本下诱导视觉标记和文本内容标记之间的软对齐。 DualAnchor 在 PHOENIX-2014T 和 CSL-Daily 上均实现了强劲的整体性能。有针对性的分析将这些收益归因于两个锚点的互补效应:TPA 提高了流畅性,而 OTA 则减少了细粒度的词汇错误。