论文
通过 LLM 引导视频拼接实现手语翻译的语料库增强
Corpus Augmentation for Sign Language Translation via LLM-Guided Video Stitching
摘要
手语翻译 (SLT) 可将手语视频转换为口语文本,对于提高可访问性以及实现手语社区和非手语社区之间的沟通具有重要前景。虽然大型弱对齐数据集已经大规模启用了 预训练,并且无光泽方法减少了对专家注释的依赖,但 微调 的高质量平行符号视频文本对仍然稀缺,限制了长尾词汇和看不见的结构的泛化。我们提出了一种语料库增强方法,不需要额外的人工注释、外部手语视频语料库或生成视频模型,仅依靠现有的注释注释训练语料库和 LLM 进行句子生成:通过 CTC 强制对齐从训练视频中提取每个注释片段,通过语料库锚定的 LLM 生成新的注释句子对,并通过随机句子采样和剪辑分配。生成的合成 RGB 视频-文本对在下游训练阶段与架构无关,可以直接由基于 RGB 的 SLT 模型使用,或者通过从视频派生此类输入的管道转换为姿势或特征表示。辛坎等人。在严格相同的条件下重新评估了五种最新的无光泽方法;相对于 GFSLT-VLP 基线的最大经验证增益仅为 0.98 BLEU-4。我们的增强在同一框架内应用,无需对架构或训练协议进行任何更改,即可实现 +2.92 BLEU-4。我们进一步发现,尽管合成数据改善了视觉语言预训练的目标,但它仍然会损害视觉语言预训练,并且在基于 L2 的标准下,优化剪辑过渡以实现视觉平滑度会适得其反;我们认为突变边界可以作为隐式正则化的一种形式。代码可在 https://github.com/robizso/slt-datagen 获取。