论文
MultiRef-Compass:对多参考音频视频生成进行综合评估
MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation
摘要
多参考音频视频 (MR2AV) 生成旨在根据多个参考和文本指令生成连贯的音频视频内容。现有的基准测试主要关注文本驱动的生成、单参考主题保存或独立的音频-视频对齐,而新兴的 MR2AV 设置在很大程度上尚未得到探索。与这些设置相比,MR2AV 要求模型对多个参考进行联合推理,同时生成同步的视觉和音频内容。模型不仅必须忠实地保留每个引用,而且必须正确地将多个引用实体绑定并组合成连贯的视听事件。为了解决这一差距,我们引入了 MultiRef-Compass,这是 MR2AV 生成的统一基准。它包含350 个精心策划的样本,这些样本是通过可扩展且可控的资产组合管道构建的,涵盖多视图主题保存、多实体绑定和人物场景组合。为了提供可解释的评估,MultiRef-Compass 使用 14 个子指标定义了具有四个维度的评估协议:基本质量、参考一致性、视听一致性和指令遵循。 MultiRef-Compass 将自动指标与重新判断增强型 MLLM-as-a-Judge 框架集成在一起,从而能够对感知保真度和参考条件合成进行可扩展且可审核的评估。对八个代表性 MR2AV 系统进行的广泛实验揭示了多个评估维度的巨大改进空间,强调了对综合基准的需求,并将 MultiRef-Compass 定位为未来 MR2AV 研究的基础。