论文
SuperVoxelGPT:用于自回归形状生成的自适应有序 3D 标记化
SuperVoxelGPT: Adaptive and Ordered 3D Tokenization for Autoregressive Shape Generation
摘要
自回归多模态 大语言模型 (MLLM) 可以实现 3D 生成,但由于 3D 标记化不足,难以扩展到高分辨率形状。基于紧凑集的表示丢弃确定性的空间排序,导致模糊的序列预测,而统一或基于八叉树的体素网格以严重冗余和过长序列为代价保留排序。这种结构性权衡限制了稳定且高效的自回归 3D 生成。我们提出了 SuperVoxelGPT,这是一个表示优先的框架,它通过自适应和确定性有序的超体素标记化来解决这种紧张关系。根据提示,我们首先预测粗略的几何显着性分布,并使用显着性引导的质心 Voronoi 曲面细分构建形状自适应的超体素分区,将细粒度单元分配给复杂区域,将较大单元分配给平滑区域。在此提示和有序的超级体素布局的条件下,我们引入了 SuperVoxelVAE 并微调预训练的 MLLM 以自回归生成超级体素标记。使用 Trellis-500K 数据的实验表明,SuperVoxelGPT 将标记序列长度减少到统一体素标记化的 12.8%,同时实现了最先进的生成质量,并且比之前的方法平均加速 10 倍。