论文

PVSync:联合评估口型时间同步与发音匹配

PVSync: A Unified Lip-Sync Expert for Timing and Articulation

模型评测应用与实践评测方法与指标内容创作

摘要

嘴唇的动作可以匹配讲话的时间,而不需要匹配所说的声音。我们引入了 PVSync,一个用于视听偏移估计和音素级清晰度评分的统一模型。 PVSync 将窗口级对比学习与音素级清晰度目标相结合,以实现同步,从而跨剪辑对齐同一视素类的音频和视频嵌入。视素将具有相似可见发音的音素分组。视位标签是从强制对齐的转录本中自动得出的,无需手动注释。在来自 13 个头部说话视频生成模型的偏移校正视频上,PVSync 比 LSE-C 更接近人类对口型同步质量的排名,实现了 0.83 与 0.34 的 Spearman 相关性。在根据保留语音自动构建的基准上,PVSync 将视位匹配与不匹配的视听对区分开来,ROC AUC 为 0.91。 PVSync 在保留的野外剪辑的时间偏移恢复方面也优于 SyncNet 和 MTD-VocaLiST。代码和基准数据将在接受后发布。

PVSync:联合评估口型时间同步与发音匹配:论文原图
图 1:(a) 生成的剪辑中发现局部发音错误:/p/ 的每个音素得分(嘴唇从不闭合)低于标志阈值。 (b) 十三个头部说话视频生成模型的人类排名与指标排名。