论文

SignLlama:通过优先考虑 LLM 的视觉功能来增强无光泽手语翻译

SignLlama: Enhancing Gloss-free Sign Language Translation by Prioritizing Visual Features for LLMs

摘要

大语言模型 (LLM) 在广泛的任务中取得了显着的成功。然而,用于无光泽手语翻译 (GFSLT) 的 微调 LLM 仍然是一个挑战。在本文中,我们研究了如何有效地将 LLM 应用于 GFSLT 任务。我们表明有两个关键问题需要解决:(1)视觉特征输入和文本特征输入之间固有的分布差距使得LLM难以解释视觉输入; (2)现有方法通常在自回归框架中连接视觉和文本特征,这导致模型过分强调文本输入并忽视视觉提示,因为 LLM 主要是在以文本为中心的数据上进行预训练的。为了解决第一个挑战,我们提出了一种简单而有效的方法,名为过滤伪光泽 CTC 预训练,该方法利用从文本序列生成的过滤伪光泽序列来监督视觉主干的训练。为了解决第二个问题,我们引入了视觉优先 蒸馏 训练策略。具体来说,我们定义了一个仅视觉的预测路径,其中文本输入被屏蔽,并且模型需要仅依赖于视觉输入来生成目标序列。为了引导这条路径,标准视觉文本预测的输出随后被提炼到纯视觉预测路径中,从而鼓励模型优先考虑视觉特征。综合实验和定性分析证明了所提出模型的有效性。所提出的 SignLlama 在 GFSLT 任务的多个数据集上实现了非常有竞争力的性能,无需使用任何额外的模式或外部手语数据集进行预训练。