论文
图像模型可以想象时间吗? ImageTime:通过时空一致性探索视觉世界建模的新基准
Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency
摘要
图像生成模型现在可以生成高质量的静态图像,但人们对它们表示视觉世界如何随时间变化的能力仍然知之甚少。故事板、分步插图、参考引导编辑和视频预可视化等实际工作流程需要模型在多个视觉状态下保留身份、对象、空间关系和因果顺序。现有的评估主要衡量单图像的正确性、构图对齐或视频质量,而图像模型是否能够连贯地想象一个时间顺序的过程仍然悬而未决。我们引入了 ImageTime,这是一种诊断基准,它使用时空一致性作为图像生成中视觉世界建模的行为探针。给定一个动作指令,以及可选的指定初始状态的参考图像,模型必须生成一个包含四个有序关键状态的图像:初始状态、动作开始、过渡状态和最终状态。这种四关键帧协议比单图像生成对时间要求更高,同时避免了密集视频动态的混淆。 ImageTime 使用渐进的能力层次结构来组织任务,并将每个场景分解为阶段性状态谓词、跨帧时间约束和禁止的因果违规。 GPT-5.5 根据结构化 VLM 作为评判协议对所有生成的图像进行评分,生成可解释的能力分数、诊断子分数和故障标签。通过多系列基准测试,ImageTime 揭示了当前图像生成系统在要求随着时间的推移保持连贯的视觉世界状态时成功、失败和漂移的地方。