论文

SLU-2K:基于问题的手语翻译语义评估基准

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

模型评测基准与评测资源

摘要

手语翻译 (SLT) 通常使用 BLEU 和 ROUGE 等表面形式指标进行评估,这些指标奖励词汇重叠,但不直接衡量翻译是否保留了源符号序列的含义。这与将 SLT 集成到辅助技术中的最终目标形成鲜明对比。在这项工作中,我们将重点从手语翻译(SLT)转移到手语理解(SLU),特别强调语义理解。具体来说,我们根据系统从输入视频中正确恢复原始句子的关键语义方面的能力来评估系统,例如发生的动作以及有关人和物体的事实。为了系统地进行这种评估,我们提出了 SLU-2K,这是一个基于流行的 PHOENIX-2014T 和 CSL-Daily 数据集的包含 2,350 个封闭式视频问答对的数据集。为了获得 SLU-2K,我们提出并广泛评估了一个自动数据生成管道,该管道产生 7 个类别的问题,即行动、位置、数字、物体、人员、时间和天气条件。我们通过评估流行的多模式 大语言模型 (MLLM) 和两个代表性的最先进系统 MMSTL 和 SpaMo 来展示 SLU-2K 的潜力。我们的结果表明,MLLM 达到了接近随机的性能,这凸显了在当前 AI 系统中更系统地集成 SLU 的必要性。此外,根据领域内数据仔细微调的最先进的翻译系统仍然表现出巨大的语义差距,结果范围从 56.7% 到 75.2%。这些发现表明,当前的 SLT 评估协议高估了真实理解,未来的进展不仅应该通过流畅性和 n 元语法重叠来衡量,还应该通过语义正确性来衡量。代码、提示和基准文件可从 https://github.com/ZenoTsT/SLU-2K 获取