论文

ES3D:将语义嵌入 3D 空间以进行组件感知编辑

ES3D: Embedding Semantics into 3D Space for Component-Aware Editing

应用与实践内容创作

摘要

现有的 3D 编辑方法在可控性方面取得了显着进步,但在几个重要方面仍然受到限制。大多数方法依赖于文本驱动的编辑,这很难表达用户意图的细粒度视觉变化。此外,许多方法需要手动提供 3D 掩模或对应保持不变的区域引入意外的更改。这些限制很大程度上源于缺乏细粒度的语义理解,使得现有模型难以检索或修改特定的 3D 组件。我们引入了 ES3D,这是一个将语义直接嵌入到 3D 空间中的框架,支持基于多个本地参考图像和可选文本查询的 3D 资产的组件感知检索和编辑。我们首先通过将多视图语义特征投影到资产的体素化空间中来构建 3D 语义嵌入。然后,我们通过计算 3D 语义嵌入与图像或文本查询的语义嵌入之间的特征相似性来执行 3D 组件检索。对于编辑,我们采用带有修复机制的预训练 3D 生成模型来修改由用户提供的图像引导的检索到的组件,同时保留资产的其余部分。总的来说,ES3D 是一个 3D 编辑框架,它根据语义线索检索可编辑区域,并使用多个图像作为条件。大量实验表明,ES3D 可以生成几何一致和语义一致的编辑,从而为 3D 编辑提供强大的基于图像和文本辅助的控制。