论文
YoCausal:视频生成距离世界模型还有多远?因果关系的观点
YoCausal: How Far is Video Generation from World Model? A Causality Perspective
摘要
随着视频扩散模型 (VDM) 向世界模型迈进,一个关键问题出现了:它们是否真正理解因果关系,或者只是过度拟合统计时间模式?现有的基准主要依赖于合成数据,由于模拟与真实的差距而限制了现实世界的泛化。我们提出了 YoCausal,这是一个两级基准,其灵感来自于认知科学的违反期望 (VoE) 范式。通过以零成本将现实世界的视频暂时反转为自然反事实样本,YoCausal 建立了一个任意可扩展的评估协议。第 1 级引入了反向惊喜指数 (RSI),通过去噪损失量化时间箭头感知。第 2 级引入了因果认知指数 (CCI),它利用 VLM 将数据集分层为因果子集和非因果子集,从而将真正的因果推理与时间偏差分开。对 13 个最先进的 VDM 的评估表明,感知时间之箭并不意味着理解因果关系,并且相对于人类水平的因果认知仍然存在显着差距。项目页面:https://www.youzhexie.me/papers/YoCausal/