论文
联合音频-视频生成模型理解物理吗?
Do Joint Audio-Video Generation Models Understand Physics?
摘要
联合音视频生成模型正在迅速接近专业制作质量,提出了一个核心问题:它们是否理解视听物理,或者仅仅生成违反现实世界一致性的合理声音和帧?我们推出了 AV-Phys Bench,这是一个评估联合音频视频生成中的物理常识的基准。 AV-Phys Bench 测试三个场景类别的模型:稳态、事件转换和环境转换。它涵盖了从现实世界场景中提取的基于物理的子类别,以及故意要求物理上不一致的音频-视频行为的反视听物理提示。每一代都从五个维度进行评估:视觉语义依从性、音频语义依从性、视觉物理常识、音频物理常识和跨模态物理常识。在三个专有模型和四个开源模型中,我们发现 Seedance 2.0 总体表现最佳,但所有模型仍远未达到可靠的物理理解。在事件驱动和环境驱动的转换中,性能急剧下降,甚至强大的专有系统也会在反视音频物理提示下崩溃。我们进一步介绍了 AV-Phys Agent,这是一种 ReAct 风格的评估器,它将多模态语言模型与确定性声学测量工具相结合,产生与人类评分密切相关的排名。我们的结果将跨模式物理一致性和过渡驱动的场景动态确定为联合音频视频生成的关键开放挑战。