论文
GAP3D:VLM 潜伏与 3D 生成的补丁级嵌入的生成对齐
GAP3D: Generative Alignment of VLM Latents to Patch-Level Embeddings for 3D Generation
摘要
最近将视觉语言模型 (VLM) 集成为生成模型调节的提示编码器的方法通常依赖于昂贵的端到端训练或将特征映射到压缩表示,从而放弃了 3D 资产生成等几何感知任务所需的密集空间结构。为了解决这个问题,我们提出了 GAP3D,这是一种基于扩散的模块化方法,它将 VLM 生成的潜在特征直接与预训练图像编码器的完整、补丁级特征空间对齐,从而使冻结的下游生成模型能够利用 VLM 作为提示编码器,同时保持空间结构化调节信号。通过对 3D 资产生成进行评估,我们的方法通过主要在通用领域图像-文本对上进行训练,从而绕过了对大规模 3D 数据的需求。尽管专门针对文本输入进行了训练,但它还展现了多模式提示的紧急零样本功能。最后,虽然目前优先考虑高级语义而不是细粒度细节,但 GAP3D 表明,VLM 和图像编码器特征空间之间的表示差距可以通过基于扩散的对齐来部分弥合,通过生成对齐到密集嵌入空间,迈出了基础模型模块化集成的第一步。