论文
DirectorBench:通过个性化多智能体评估诊断长视频生成
DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation
摘要
长视频生成正在迅速从短的单场景合成转向具有叙事结构、电影控制、音频和跨模式同步的一分钟长的多镜头创作。然而,评估此类视频仍然具有挑战性,因为现有基准主要关注局部视觉质量、短视时间一致性或通用提示对齐,并且对工作流程故障和用户相关偏好提供有限的诊断。我们推出了DirectorBench,这是一种用于长格式视频生成的个性化多代理诊断基准。 DirectorBench 根据 80 个结构化元数据条目、7 个用户配置文件和跨 5 个维度的 40 个检查点标准来评估生成的视频:脚本、视觉、音频、跨模式和稳定性。 DirectorBench 不会将质量降低到单个总分,而是定位检查点级瓶颈并支持配置文件感知评估。我们评估了 4 个长格式视频生成工作流程、6 个基本 LLM 和 7 个用户配置文件。在整个工作流程中,DirectorBench 揭示了单元间的瓶颈:过渡质量平均仅为 0.256,最佳工作流程达到 0.356,而提示级用户需求满足平均为 0.71。我们进一步与 14 名注释者进行人工评估,以验证 DirectorBench 和人工判断之间的一致性。结果表明,DirectorBench 捕获了人类可感知的质量差异,并揭示了被聚合评分隐藏的与工作流程和配置文件相关的故障模式。这些发现强调了诊断和配置文件感知基准测试对于长视频生成的重要性。