论文
ROAD:3D 形状生成的判别语义的相互目标对齐
ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation
摘要
高保真 3D 生成主要依赖于缩放模型容量和数据,这会产生高昂的计算成本。这种范式通常需要从头开始学习几何,并且忽略了已经封装在判别性 3D 基础模型中的丰富语义和结构先验。我们认为,利用这些判别模型对 3D 世界的深刻理解可以显着降低生成成本。为此,我们提出了 ROAD,这是一个框架,通过将这些丰富的判别先验转移到扩散 Transformer 中来降低 3D 生成的训练成本。为了解决生成潜伏和判别潜伏之间固有的语义结构异质性,我们引入了一种互惠目标对齐策略。该方法协同整体语义压缩来增强全局语义一致性和结构最佳对齐,结构最优对齐被表述为二分匹配问题,以严格对齐不同潜在空间之间的微观几何细节。 3D基础模型仅用于训练时的对齐监督,不用于推理,不会产生额外的推理成本。与工业基线Step1X-3D相比,所提出的ROAD仅用1.5%的训练数据就实现了极具竞争力的生成性能,并显着降低了训练成本,有效降低了高保真3D生成的计算开销。代码可在 https://github.com/H-EmbodVis/ROAD 获取。