论文

Position Forcing:以位置自条件化增强三维生成

Position Forcing: Self-Conditioning 3D Generation

模型架构应用与实践新型架构内容创作视觉感知与空间理解

摘要

最近的单阶段 3D 生成模型通常采用 VecSet 表示,将 3D 形状编码为无序的潜在标记集。然而,与提供明确位置指导的两阶段方法相比,这些模型必须在整个去噪过程中隐式推断Token位置,从而限制了它们的生成质量。我们观察到,尽管缺乏明确的位置条件,VecSet 标记仍保留可恢复的空间对应关系。基于这一观察,我们提出了位置强迫,一种基于位置的自我调节框架。在去噪期间,位置强制从当前干净的潜在估计中恢复标记位置,根据去噪阶段以逐渐更精细的分辨率对它们进行量化,并将生成的位置编码反馈回扩散Transformer。这种逐步细化的位置反馈以适合每个去噪阶段的粒度提供空间指导,沿着从粗到细的轨迹引导形状生成,并在无需单独位置的情况下显着提高生成质量 一代阶段。实验表明,Position Forcing 在单阶段 3D 生成方法中实现了强大的性能,并且优于多种竞争性多阶段方法。

Position Forcing:以位置自条件化增强三维生成:论文原图
图 1:我们的观察和位置调节设计。 (I) 潜伏可以被解码为形状几何和标记位置。 (II) (a) VecSet 不使用显式位置条件; (b) VoxSet 和两级管道使用预先建立的位置。 (c) 我们的简单设计从当前的噪声状态中恢复位置。 (d)位置强制从预测的干净状态恢复位置并应用渐进量化以提供从粗到细的空间引导。