论文

IntactWorld:具有完整特征的联合世界建模

IntactWorld: Joint World Modeling with Intact Features

模型架构应用与实践混合架构视觉感知与空间理解

摘要

虽然最近的视频生成模型合成了高度逼真的视觉效果,但它们缺乏对内在现实世界逻辑的真正理解。现有的方法试图通过内化不同的世界知识来理解世界,但受到计算开销或维度对齐的限制,其学习过程不可避免地压缩特征,导致结构信息的严重丢失。为了解决这个问题,我们提出了 \textbf{IntactWorld},一种利用未压缩的 \textbf{Intact Features} 的 \textbf{Joint World Modeling Architecture}。由于数据自然驻留在高维空间内的低维流形上,因此预测此未压缩的高维空间内的流速 $v$ 会导致严重的流形间隙。为了成功消除这个优化瓶颈,我们的框架在中间层预测干净的特征 $x_0$。此外,为了减轻整合完整世界知识的计算开销,我们引入了 \textit{Full-to-Compact Training Paradigm}。通过用高度精炼的 CLS 替换原始的完整功能 token,此范例可实现高效的单分支指导,将空间内存消耗减少 11.4%,并将推理延迟减少 43.8%。广泛的评估证明了 IntactWorld 的有效性,在 VBench 2.0 基准测试中比既定基线高出 2.46 分。