论文

Align then Reason:配音的多模态口型同步判断器

Align Then Reason: A Multimodal Lip-Sync Judge for Dubbing

模型推理推理验证与自校正

摘要

配音质量控制需要一个无参考的判断器,可以仅使用无声视频和文本来确定候选文本行在内容和时间上是否与说话者的可见发音相匹配,因为配音的音频可能尚不存在。现有的视觉语音识别器和视频语言模型不太适合这种设置:即使经过微调以从嘴唇运动中恢复口头内容,它们仍然对时间错误基本上不敏感。我们引入了 $Align Then Reason$ (ATR),一种多语言唇形同步判断器,它首先在帧级唇形表示和候选行的语音单元之间建立单调对齐,然后对该对齐进行推理以做出最终判断。对齐评分器为大语言模型提供每个语音单元的本地证据和校准的全局对齐分数,使其能够联合推理内容和时间。在七种语言基准上,我们的方法使用 2B、4B 和 9B 推理器将平均 AUC 比相应的 Qwen3.5 SFT 基线分别提高了 59.4%、50.2% 和 50.8%。这些成果遍及 LLM 系列,与 LLaMA-3.1-8B 和 Mistral-7B 的最佳基线相比,平均 AUC 分别提高了 45.9% 和 46.6%。他们还跨数据集传输到三种前所未见的 MuAViC 语言。此外,我们评估了根据真实配音台词构建的两个下游任务。在配音线重新排名中,ATR-9B 比最佳唇读基线高出 52.0%,而在脚本到剪辑分配上,ATR-9B 比最佳唇读基线高出 17.7%。