论文

CNSL-bench:对中国国家手语 MLLM 的手语理解能力进行基准测试

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

模型评测基准与评测资源

摘要

由于大语言模型(LLM)的进步,手语研究取得了重大进展。然而,LLM 理解手语的内在能力,尤其是在多模态环境中,仍有待探索。为了解决这一限制,我们推出了 CNSL-bench,这是第一个综合性的中国国家手语基准测试,旨在评估手语理解中的多模态 大语言模型 (MLLM)。拟议的 CNSL 基准具有以下特点: 1) 权威性,因为它以官方标准化的 \textit{国家通用手语词典为基础,减少了区域或非规范变体的歧义,并确保语义定义的一致性; 2)多模态覆盖,提供一致的文字描述、说明性图像和手语视频; 3)发音多样性,支持对主要手工发音形式的细粒度分析,包括空中书写、手指拼写和中文手工字母表。使用 CNSL-bench,我们广泛评估了 21 个开源和专有的最新 MLLM。我们的结果表明,尽管多模态建模最近取得了进展,但当前的 MLLM 仍然大大低于人类的表现,在输入模式和手动发音形式之间表现出系统差异。其他诊断分析表明,除了推理方面的改进之外,还存在一些性能限制,并且指令遵循的稳健性在不同模型之间存在很大差异。