论文

LLM时代的手语识别

Sign Language Recognition in the Age of LLMs

模型评测模型能力评测

摘要

最近的视觉语言模型(VLM)在广泛的多模态推理任务中表现出了强大的性能。这就提出了这样的问题:这种通用模型是否也可以解决专门的视觉识别问题,例如无需特定任务训练的孤立手语识别(ISLR)。在这项工作中,我们研究了现代 VLM 在零样本设置下执行 ISLR 的能力。我们在 WLASL300 基准测试上评估了多个开源和专有的 VLM。我们的实验表明,在仅提示零样本推理下,当前的开源 VLM 仍然远远落后于经典的监督 ISLR 分类器。然而,后续实验表明,这些模型捕获了符号和文本描述之间的部分视觉语义对齐。较大的专有模型可实现更高的准确性,凸显了模型规模和训练数据多样性的重要性。我们所有的代码都可以在 GitHub 上公开获取。