论文
ViPo-MLLM:用于无光泽手语翻译的 Visual-Pose Multimodal LLM
ViPo-MLLM: Visual-Pose Multimodal LLM for Gloss-Free Sign Language Translation
摘要
无光泽手语翻译 (SLT) 可将手语视频翻译成口语句子,无需注释,避免了昂贵的标签,但需要对手、身体和面部线索进行细粒度建模。现有方法通常使用单模态或弱融合特征,限制了性能。我们提出了 ViPo-MLLM,一个集成时空 RGB 和人体姿势特征的框架。专用编码器对模态内动态进行建模,跨模态注意力捕获长程依赖性。融合表示以结构化提示为条件,并由经过对比和语言建模目标训练的 LLM 进行处理。所提出的模型在 PHOENIX14T 和 CSL-Daily 数据集上进行了评估,并在这两个数据集上取得了最新的结果。此外,与基于光泽的识别方法相比,ViPo-MLLM 模型获得了有竞争力的性能,证实了所提出的姿势线索和跨模式注意机制的有效性。