论文

无光泽手语翻译的选择性对比学习

Selective Contrastive Learning For Gloss Free Sign Language Translation

应用与实践机器翻译

摘要

手语翻译 (SLT) 将连续的手语视频转换为口语文本,但由于视觉符号和书面文本之间固有的模态不匹配,尤其是在无光泽的环境中,它仍然具有挑战性。最近的 SLT 系统越来越多地采用类似 CLIP 的视觉语言预训练 (VLP) 进行跨模态对齐,但随机批内对比提供的批处理相关的负例很少,并且可能会将语义相似(甚至相同)的对错误标记为负例,从而引入噪声和可能不一致的对齐监督。在这项工作中,我们首先进行初步的基于轨迹的分析,跟踪训练期间的负视频文本相似性。结果表明,只有一小部分负片表现出持续被推开的预期行为,而其余负片则表现出异质且通常不降低的相似性动态,这表明随机批量负片通常无法提供有效对齐的信息。受此启发,我们提出了带有配对选择(PS)策略的选择性对比学习 SLT(SCL-SLT)。 PS 使用参考检查点的相似性动态对候选负例进行评分,并通过逐渐强调更具挑战性的负例的课程构建小批量,从而加强对比监督,同时减少噪声或语义无效负例的影响。