论文

SlotDiT:扩散Transformer的以对象为中心的表示

SlotDiT: Object-Centric Representations for Diffusion Transformers

模型架构新型架构

摘要

文本条件潜在扩散模型在视频生成中表现强劲,是机器人应用的有希望的支柱。然而,现有方法依赖于像素级或基于 VAE 的潜在表示,缺乏明确的语义结构,使得表示空间的影响在很大程度上未被探索。基于槽的以对象为中心的表示通过将场景分解为对象级潜在对象或槽来提供结构化替代方案。虽然它们在动力学建模和规划方面取得了成功,但尚未针对基于扩散的生成建模进行探索。我们引入了 SlotDiT,一种在基于槽的潜在空间中运行的文本引导扩散变换器 (DiT)。给定参考图像和语言指令,SlotDiT 将场景分解为代表各个实体的以对象为中心的槽。根据指令和观察到的场景上下文,该模型对未来的槽轨迹进行自回归降噪以预测场景动态。为了系统地研究扩散Transformer的潜在空间设计,我们在统一的 DiT 框架内将基于槽的表示与基于 VAE 和语义对齐的替代方案进行比较。我们的实验表明,使用槽作为 DiT 潜在变量可以产生具有竞争力的视频生成质量,同时持续提高四个机器人数据集的任务完成率。此外,它们的紧凑表示为基于 VAE 和语义对齐的潜在空间提供了一种计算高效的替代方案。总的来说,我们的结果表明,以对象为中心的结构是机器人环境中基于扩散的生成建模的强大归纳偏差。项目页面位于 https://slot-dit.github.io/。