论文
从孤立的符号走向连续的手语对话
Towards Continuous Sign Language Conversation from Isolated Signs
摘要
手语是许多聋哑人和听力困难 (DHH) 手语者的主要语言,但大多数对话式人工智能系统仍然通过口头或书面语言进行交互。这种以口语为中心的界面可以限制口语或书面语言不是最容易访问的媒介的手语者的访问,从而促进直接手语对话建模。然而,句子级手语视频数据的收集和注释成本高昂,导致现有的手语翻译和制作模型词汇覆盖范围有限,开放域泛化能力较弱。我们通过从孤立的符号构建连续的符号对话来解决这个瓶颈:大规模标记的孤立的剪辑被收集为基于词汇的运动原语,并重新组合成从现有对话语料库派生的手语排序的话语。我们介绍了 SignaVox-W,据我们所知,它提供了迄今为止最大的标记孤立手势词汇表,以及 SignaVox-U,这是一个由 SignaVox-W 构建的连续 3D 手势对话数据集。为了弥合口语和手语之间的结构不匹配,我们使用检索引导的口语翻译器;为了桥接独立收集的孤立剪辑,我们提出了 BRAID,这是一种扩散 Transformer,可以执行持续时间对齐和联合发音边界修复。利用所得数据,我们训练 SignaVox,这是一种直接手语对话模型,可根据先前的手语上下文生成 3D 身体、手部和面部运动响应,而无需口语文本或在推理时外部提供的注释。定量和定性评估显示,孤立到连续的运动质量得到了改善,响应级别语义对齐更强,以及可扩展的以手语者为中心的交互,可以更好地支持视觉空间清晰度。