论文

具有全局视频上下文的视频引导机器翻译

Video-guided Machine Translation with Global Video Context

应用与实践机器翻译

摘要

视频引导多模态翻译(VMT)近年来取得了显着进展。然而,大多数现有方法依赖于与字幕一对一配对的本地对齐视频片段,限制了它们在长视频中跨多个片段捕获全局叙事上下文的能力。为了克服这一限制,我们提出了一种全局视频引导的多模态翻译框架,该框架利用预训练的语义编码器和基于矢量数据库的字幕检索来构建与目标字幕语义密切相关的视频片段的上下文集。采用注意力机制来关注高度相关的视觉内容,同时保留剩余的视频特征以保留更广泛的上下文信息。此外,我们设计了一种区域感知的跨模式注意机制来增强翻译过程中的语义对齐。在大规模纪录片翻译数据集上的实验表明,我们的方法显着优于基线模型,凸显了其在长视频场景中的有效性。