论文

MTAVG-Bench 2.0:多说话人音视频生成中电影表现力的失效模式诊断

MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation

模型评测基准与评测资源

摘要

近年来,多说话人音视频生成(MTAVG)模型在唇形同步、视听对齐等基础指标上展现出可观的性能。然而,这些指标仍不足以评估场景级生成中的电影表现力。在多角色场景中,生成模型必须超越视听真实感,传达连贯的角色表演及其他更高层次的电影品质。为填补这一空白,我们提出MTAVG-Bench 2.0,一个用于诊断多说话人音视频生成中电影表现力失效模式的基准。不同于以往主要关注基础多轮对话质量的设定,MTAVG-Bench 2.0瞄准短剧与场景级生成,建立了覆盖表演、叙事、氛围与视听语言的高层失效分类体系。基于该分类体系,我们构建了一万余个问答式评测实例,并附带短剧级评估与失效模式时间定位子集,以系统评估全模态大语言模型诊断高层视听失效的能力。实验结果显示,Gemini等商业全模态模型显著优于其他评估者,但即便最强的模型在我们的基准上仍难以应对复杂失效。这些结果证明MTAVG-Bench 2.0为电影化多说话人音视频生成的失效诊断提供了系统化基准。

MTAVG-Bench 2.0:多说话人音视频生成中电影表现力的失效模式诊断:论文配图
图1:MTAVG-Bench 2.0框架总览,经影片分析、选择性脚本提示、文本到音视频生成、失效发现、问题生成与人工校验构建基准。