论文
CaliBench:视频世界模型的随机动力学是否经过物理校准?
CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated?
摘要
视频世界模型通过生成采样来近似物理结果的随机分布,但现有的基准对各个代进行评分或粗略地比较整个数据集的分布,从而使特定现象的细粒度任意不确定性未经测试。我们引入了 CaliBench,它在物理上可解释的离散空间(bin 索引、骰子面、西装、颜色)中对结果进行评分,而不是在 FID 中学习的特征空间,因此可以直接测量与已知参考分布的距离。我们策划结果空间,其参考以封闭形式已知(二项式高尔顿板、伯努利叉子、统一的骰子/卡片/彩票、倾斜的欧式轮盘赌颜色),从而实现精确的校准测试。我们将性能分解为两个正交轴,将单个精度指标合并为两个正交轴:可评分性(产生可评分结果的代的分数)和校准(与该样本的参考值的总变异距离)。卡方检验评估显着性;由于校准是其零假设,因此它只能证明校准错误,并且在 N=32 时,每个单元仅检测到较大偏差。我们将其应用于 9 个场景和 6 个图像到视频模型(WAN-2.7、SeeDance-2.0、HappyHorse-1.0、Veo 3.1、Runway Gen-4.5、Cosmos3-Super),每个模型 32 代。模型始终将概率质量集中在少数结果上,而不是复制参考。大多数场景模型组合都严重错误校准,在极端情况下会崩溃为一种结果,就像 Veo 3.1 在骰子上所做的那样。在轮盘赌上,几代人经常将球放置得不明确,导致某些模型的得分较低。性能因场景而异:没有一个模型能够主宰所有九个场景。我们发布了协议和指标(平均归一化总变异,mnTV),用于将新模型与我们的结果进行比较。