论文
迈向多视角手语理解:基准数据集和基线
Towards Multi-View Sign Language Understanding: A Benchmark Dataset and Baseline
摘要
大多数现有的手语理解(SLU)方法都是在固定视图设置下开发的,并且仍然容易受到观点变化的影响,而多视图数据的稀缺阻碍了对观点鲁棒性的系统研究。为了解决这一差距,我们引入了 \textbf{MVSign},这是一个涵盖三种手语和七个观点的基准。 MVSign 将现有数据集的原始正面记录与通过 $3$D 全身运动重建和目标视图渲染合成的附加视图相结合,同时保留源分割和注释。我们进一步提出了 \textbf{CanonSLU},一个多视图 SLU 的框架。该框架采用规范视图引导策略,使用正面视图作为语义锚。具体来说,CanonSLU 结合了 \emph{规范视图知识转移 (CKT)} 将规范知识从正面视图转移到非正面视图,并结合 \emph{运动关系聚合 (MRA)} 来聚合跨帧的运动相关特征并加强视点变化下的时间表示。 MVSign 上的大量实验证明了在非正面视图方面具有竞争力的性能,将 CanonSLU 确立为多视图 SLU 的有效基准。