论文
一帧只需一个词元:使用 Delta 词元进行高效的生成世界建模
A Frame is Worth One Token: Efficient Generative World Modeling with Delta Tokens
摘要
预测不同的未来状态是视频世界建模的核心挑战。判别式世界模型产生确定性预测,隐式地对可能的未来进行平均,而现有的生成式世界模型的计算成本仍然很高。最近的工作表明,在视觉基础模型(VFM)的特征空间(而不是针对像素重建优化的潜在空间)中预测未来所需的世界模型参数要少得多。然而,大多数此类方法仍然具有歧视性。在这项工作中,我们介绍了 DeltaTok,一种将连续帧之间的 VFM 特征差异编码为单个连续“delta”标记的分词器,以及 DeltaWorld,一种对这些标记进行操作的生成世界模型,以有效地生成各种可能的未来。 Delta 词元将视频从三维时空表示减少为一维时间序列,例如使用 512x512 帧产生 1,024 倍的词元减少。这种紧凑的表示可以实现易于处理的多假设训练,其中许多未来是并行生成的,并且只有最好的受到监督。在推理时,这会导致在一次前向传递中产生不同的预测。密集预测任务的实验表明,DeltaWorld 预测的未来与现实世界的结果更加一致,同时与现有的生成世界模型相比,参数减少了 35 倍以上,使用的 FLOP 次数减少了 2,000 倍。代码和权重:https://deltatok.github.io。