论文
单因素物理视频到音频生成的基准测试
Benchmarking Single-Factor Physical Video-to-Audio Generation
摘要
生成视频转音频(V2A)模型可产生高度可信的音轨,但仍不清楚它们是否捕获了潜在的物理过程。现有的评估强调感知现实性,而忽视受控干预下的物理正确性。在本文中,我们介绍了 FlatSounds,这是一个通过以下方式审核 V2A 模型物理推理的基准:1)其中单个物理因素发生变化的受控反事实对,以及 2)探测内部一致性和方向趋势的单视频模式测试。这些设置测试生成的音频是否正确反映特定的物理属性和时序。我们对最先进模型的评估揭示了一致的权衡:模型更多地依赖文本描述文本而不是视觉流来推断物理和语义。字幕通常可以提高物理和语义的准确性,但矛盾的是会降低时间对齐。我们的结果强调需要超越音频质量,直接从像素学习物理过程。最后,我们发现基于物理的指标与人类对我们自己的数据的偏好测试密切相关。项目网页:https://research.nvidia.com/labs/cosmos-lab/flatsounds/