论文

HI3D 3.0 (Twinkle3D):高分辨率的特定对象 3D 资产生成

HI3D 3.0 (Twinkle3D): Object-specific 3D Asset Generation with High Resolution

模型架构AI 基础设施应用与实践Transformer分布式训练基础设施内容创作

摘要

图像到 3D 生成已经越来越能够生成与输入图像非常相似的对象,而一个突出的挑战是重现所描绘的对象本身,包括定义它的特定几何形状。铭文、品牌标记和重复结构经常被扭曲或丢失,尽管它们对于物体身份至关重要。我们推出了 Hi3D 3.0,这是一种针对特定对象保真度的图像到 3D 生成系统,以 Twinkle3D 作为其几何模型,用于生成分辨率为 2048^{3}$ 的防水三角形网格。 Twinkle3D 沿四个维度推进了高保真几何生成。首先,虽然 O-Voxel/FaithC 提供了很高的表示精度,但它经常受到表面质量差和不防水几何形状的影响。我们解决了这两个问题,同时保留了 $2048^{3}$ 级别的精度。其次,我们通过重新设计的 DiT 架构和大规模分布式训练优化,将扩散生成扩展到最多 300K 几何标记的序列,将每步的训练时间从大约 10 分钟减少到 10 秒。 第三,后续的细化无法完全弥补初始生成时引入的错误;因此,我们在初始生成阶段加强了全局形状和局部细节,最终的单阶段模型以 512^{3}$ 的细化超越了之前的两阶段管道。最后,我们引入了细粒度图像-3D 跨模态交互机制,该机制加强了视觉证据和几何标记之间的对应关系,从而提高了对象特定结构的恢复。我们使用从轮廓和法线场导出的对齐度量来评估几何保真度。 Hi3D 3.0 在所有报告的指标中均优于四个商业系统,以 98.2% 的精度恢复了 82.1% 的刻写字符,而最强竞争对手的召回率为 21.7%。