论文

LiveGesture 可流式协同语音手势生成模型

LiveGesture Streamable Co-Speech Gesture Generation Model

应用与实践内容创作

摘要

我们提出了 LiveGesture,这是第一个完全可流式传输、语音驱动的全身手势生成框架,它以零前瞻操作并支持任意序列长度。现有的协同语音手势方法专为离线生成而设计,要么独立处理身体区域,要么将所有关节纠缠在单个模型中,而 LiveGesture 是从头开始构建的,用于生成因果的、区域协调的运动。 LiveGesture 包含两个主要模块:可流式矢量量化运动标记器 (SVQ) 和分层自回归 Transformer (HAR)。 SVQ 标记器将每个身体区域的运动序列转换为因果离散运动标记,从而实现实时、可流式标记解码。在 SVQ 之上,HAR 采用区域专家自回归 (xAR) Transformer 来对每个身体区域的富有表现力的细粒度运动动力学进行建模。然后,因果时空融合模块(xAR Fusion)捕获并整合跨区域的相关运动动态。 xAR 和 xAR Fusion 均以由可流式因果音频编码器编码的实时、连续到达的音频信号为条件。为了增强流噪声和预测误差下的鲁棒性,我们引入了自回归掩蔽训练,它利用不确定性引导的标记掩蔽和随机区域掩蔽来使模型在训练期间暴露于不完美、部分错误的历史。 BEAT2 数据集上的实验表明,LiveGesture 可以实时产生连贯、多样且节拍同步的全身手势,在真正的零前瞻条件下匹配或超越最先进的离线方法。