论文

SignNet-1M:具有下游基准的大规模多语言手语视频数据集

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

模型评测基准与评测资源

摘要

手语模型通常是在受限条件下捕获的数据集上进行训练的,这些数据集的观点、背景和手语者身份多样性有限,导致在现实世界的分布变化下鲁棒性较差。我们介绍 SignNet-1M,这是一个涵盖 ASL、CSL 和德国手语 (DGS) 的大规模增强数据集。 SignNet-1M 沿三个轴合成真实变化:(i) 通过 3D 高斯泼溅 (3DGS) 进行新颖视图渲染(旋转和缩放),(ii) 通过扩散模型进行场景/身份编辑,用于背景替换和手语替换,同时保留手语运动和语言内容,以及 (iii) 模拟捕获和压缩伪影(例如姿势/时间扰动和视频级损坏)的渲染后增强,以更好地匹配野外录音。除了数据发布之外,我们还提供跨下游任务(例如翻译和识别)的统一基准套件以及隔离每个增强组件的消融。跨主干网的实验表明,使用 SignNet-1M 进行训练可以持续提高跨视图、跨背景、跨身份和渲染后转换下的泛化能力,同时保持强大的分布内性能。数据集、完整的增强管道和基准可在 https://signnet.chatsign.ai/ 上获取。