论文
通过自回归 3D 扩散从文本共同生成布局和形状
Co-generation of Layout and Shape from Text via Autoregressive 3D Diffusion
摘要
最近的文本到场景生成方法大大减少了创建 3D 场景所需的手动工作。然而,他们的重点是生成场景布局或生成对象,很少有人同时生成两者。即使有 LLM 的帮助,生成的场景布局通常也很简单。此外,生成的场景通常与包含对象形状、外观和空间排列的重要描述的文本输入不一致。我们提出了一种顺序文本到场景生成的新范例,并提出了一种用于交互式场景创建的新颖的生成模型。其核心是 3D 自回归扩散模型 3D-ARD+,它将多模态词元序列上的自回归生成和下一个对象 3D 潜在对象的扩散生成统一起来。为了生成下一个对象,该模型使用一个自回归步骤在场景空间中生成粗粒度的 3D 潜在对象,以当前看到的文本指令和已合成的 3D 场景为条件。然后,它使用第二步在较小的对象空间中生成 3D 潜伏,该潜伏可以解码为细粒度的对象几何形状和外观。我们整理了一个包含 23 万个室内场景的大型数据集,其中包含用于训练的配对文本指令。我们在具有挑战性的场景中评估 7B 3D-ARD+,并展示该模型可以按照文本指令规定的重要空间布局和语义生成和放置对象。