论文
Hunyuan3D-Buffalo 1.0:用于可扩展 3D 生成、理解和编辑的统一多模态模型
Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing
摘要
图像生成的最新进展证明了集成理解、生成和编辑的统一多模态模型的潜力。然而,统一的 3D 建模仍然受到多模态数据稀缺的限制,特别是缺乏大规模且几何一致的编辑数据。为了解决这个限制,我们提出了Hunyuan3D-Buffalo 1.0,这是一个统一的框架,支持在单一架构内进行3D理解、文本到3D生成、指令引导的3D编辑和基于文本的零件生成。为了实现可扩展的训练,我们构建了一个 87M 规模的 3D 多模态语料库,其中包括 25M 个理解样本、50M 个文本到 3D 对以及使用 Nano3D-v2 生成的 12M 个编辑对。在架构上,该框架将用于语义、结构和空间理解的Hunyuan3D-VLM与用于高保真3D合成的Hunyuan3D DiT相结合。 VLM 提供了用于生成的多模态语义条件,而编辑和部分生成另外调节了源对象表示上的扩散过程,以保留其整体结构和未编辑的区域。大量的实验表明,Hunyuan3D-Buffalo 1.0在文本到3D生成和3D编辑基准上实现了最先进或领先的性能,同时表现出强大的理解和零件生成能力。我们的分析进一步表明,生成和理解都能改善编辑,证明统一 3D 多模态训练的有效性。项目页面:https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0/