论文
VTaMo:用于手语翻译的视频文本对齐模型
VTaMo: Video-Text Alignment Model for Sign Language Translation
摘要
手语翻译 (SLT) 将连续的手语视频转换为口语文本。无光泽方法利用预先训练的视觉编码器和语言模型,但仅依赖于翻译监督的隐式跨模式对齐。我们提出了 VTaMo,一个在三个级别引入显式多粒度对齐的框架:(1)通过熵正则化最优传输进行局部对齐,并使用可学习的空标记来实现细粒度的帧到标记对应; (2) 通过可学习的正交变换进行全局对齐,通过地球移动器的距离校准嵌入空间几何形状; (3) 用于判别性 词元级 表示的位置对齐对比学习。 Phoenix-2014T、CSL-Daily、How2Sign 和 OpenASL 上的实验证明了一致的最先进性能,并通过消融确认了每个组件的互补贡献。代码可在 https://github.com/junyi2005/vtamo 获取。