论文
AVGen-Bench:用于文本到音频视频生成的多粒度评估的任务驱动基准
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
摘要
文本到音频视频 (T2AV) 生成正在迅速成为媒体创建的核心接口,但其评估仍然分散。现有的基准在很大程度上孤立地评估音频和视频,或者依赖于粗略的嵌入相似性,无法捕获现实提示所需的细粒度联合正确性。我们推出了 AVGen-Bench,这是一个任务驱动的 T2AV 生成基准,具有跨 11 个现实世界类别的高质量提示。为了支持综合评估,我们提出了一种多粒度评估框架,将轻量级专家模型与多模态 大语言模型 (MLLM) 相结合,实现从感知质量到细粒度语义可控性的评估。我们的评估揭示了强大的视听美学和弱语义可靠性之间的明显差距,包括文本渲染、语音连贯性、物理推理方面的持续失败以及音乐音调控制的普遍崩溃。代码和基准测试资源可从 http://aka.ms/avgenbench 获取。