论文
DiVid:诊断视频生成模型中特定维度的多样性崩溃
DiVid: Diagnosing Dimension-Specific Diversity Collapse in Video Generation Models
摘要
尽管取得了显着的进步,但视频生成模型在从同一提示中重复采样时通常会产生高度相似的输出,从而限制了它们对创造性探索的有用性。现有的多样性评估主要依赖于全局标量指标,这掩盖了视频时空空间中多样性崩溃的位置。我们引入了 DiVid,一个维度级诊断框架,它将视频生成多样性分解为六个可解释的维度:语义、风格、主题、场景、运动和摄像机。每个维度都通过可重复的计算机视觉管道进行测量,并与质量和指令忠实度一起进行分析,以检查潜在的权衡。对代表性视频生成模型的系统评估表明,多样性是高度特定于维度的:具有强大全局多样性得分的模型仍然在特定因素上崩溃,特别是运动和相机。在过滤掉不忠的一代之后,这些排名仍然存在,表明真正的能力差异,而不是临时的输出。除了测量之外,受控提示干预还发现了两个基本瓶颈:默认模式收敛,模型在开放式提示下回落到主导模式;和实现差距,模型无法忠实地实现多样化的、明确要求的替代方案,特别是对于时间因素。时间因素的较大忠实度损失凸显了仅通过文本控制运动和摄像机变化的难度。因此,DiVid 将多样性的研究从衡量多样性是否存在转向诊断多样性崩溃的位置和原因,并为维度感知训练目标和控制信号提供了可行的方向。该框架的发布将促进未来多样化、可控视频生成的研究。