论文

SignSeek:学习符号字典检索的可转移表示

SignSeek: Learning Transferable Representations for Sign Dictionary Retrieval

模型训练预训练

摘要

手语词典是手语学习者的重要资源,但由于手语者之间的自然差异,在仅给出查询视频的情况下从词典中自动检索手语仍然是一个具有挑战性的问题。现有的符号表示学习方法是为闭集识别而构建的,产生的嵌入不能推广到检索所需的开放集、独立于签名者的设置。 \textbf{SignSeek} 通过对比学习符号表示与显着性引导发音器掩蔽来缩小这一差距。对比目标可将签名者之间的相同光泽标志对齐,而我们的咬合架显着性引导遮蔽 (ASGM) 可精确定位每个标志中最关键的咬合架。这驱动了两个互补的目标,一个是通过单个发音器看到信号的掩蔽对比对齐(MAC)损失,另一个是从周围时空上下文的潜在空间中重建信号的掩蔽预测(MAP)损失。 \textbf{SignSeek} 在跨多种手语的 266K 样本($\sim$5,700 个注释)上进行了预训练,在 ASL-Citizen、WLASL 和 NMFs-CSL 上的跨语料库检索中设置了新的最先进性能,无需任何下游 微调。引人注目的是,它实现了对完全看不见的英​​国手语 (BSL) 的零样本泛化,超越了在 BSL 上明确训练的方法,并无缝转移到孤立的手语识别和字幕对齐,优于之前基于骨架的方法。