论文
用视频思考:视频生成器真的能推理现实世界吗?
Thinking in Video: Can Video Generators Really Reason About the Real World?
摘要
世界模型和视频生成的最新进展催生了一种新兴的推理范式,它利用视频生成模型来模拟、预测和推理现实世界的动态。我们将这种范式重新定义为“视频思维”,其中视频不仅仅是一种输出工件,而且是构建、扩展和验证因果思维的媒介。然而,这一承诺仍未得到验证:令人信服的生成轨迹可能反映的是记忆的外观而不是因果理解,而现有的指标将感知保真度与语义逻辑分开。为了评估视频生成器是否支持这种推理,我们引入了因果生成双判断(CGDJ),从两个角度审核世界模型一致性。显式因果感知测试生成器是否通过时空扁平化视觉问答将视频场景解读为推理问题,而隐式生成感知-预测差距则评估它是否将因果结果呈现为一致的未来视频。将 CGDJ 应用于代表性的开源和闭源生成器揭示了明显的感知预测差距:尽管显式因果感知接近于零,开源模型仍产生合理的动态,而先进的闭源系统在推理和生成之间表现出更强但仍然有限的一致性。进一步的分析揭示了视听错位,模型用语言表达正确的因果逻辑比渲染它更可靠,挑战了“世界模拟器”的叙述。