论文
整体协同语音手势生成的感知基础和语义感知评估
Perceptually Grounded and Semantics-Aware Evaluation for Holistic Co-Speech Gesture Generation
摘要
整体和语义感知的协同语音手势生成已经迅速发展,但评估仍然落后:客观指标并不能始终如一地反映人类的感知,并且语义适当性仍然难以量化。我们提出了一个基于感知和语义感知的基准,它结合了标准化模型比较、以人为中心的度量验证和细粒度语义评估。我们首先列出了 13 个客观指标,涵盖不同方面,包括分布相似性、几何保真度、运动学质量、跨模式同步性和语义适当性。对于语义适当性类别,我们提出了一个新的指标,即语义手势保留(SGP),它测量生成的手势中真实情况中的语义手势被保留的程度。为此,我们使用多模态 LLM 增强了 BEAT2 数据集的注释。然后,我们进行了一项感知研究,101 名参与者对生成的手势进行了五个维度的评分,包括人类相似性、动作多样性、没有动画错误、语音计时 和内容匹配。我们系统地分析客观指标-主观分数的相关性。语义评分 (SC) 与评估的感知维度没有显着关联,而 SGP 则有选择地与具有语音感知能力的人类判断保持一致。我们构建了五个与主观维度一致的特定目标综合指标。这些复合材料改善了所有五个维度的感知一致性,在没有动画错误和内容匹配的情况下获得了最大的收益,这表明互补的客观信号比单独的单独指标可以更好地近似人类判断。总的来说,我们的结果表明客观指标需要根据主观评估进行验证。