论文
用于高效图像到形状扩散的活力感知压缩 Transformer
Vitality-Aware Compression for Efficient Image-to-Shape Diffusion Transformers
摘要
我们提出了第一种用于图像到形状扩散 Transformer (DiTs) 的压缩方法,该方法大大减小了模型大小,同时保留了几何保真度。尽管在 3D 形状生成方面取得了显着进展,但基于 DiT 的大型模型在资源受限的环境中在计算上仍然令人望而却步。此外,很难将针对不同领域开发的现有扩散模型压缩策略直接转移到 3D 生成,并且先前的 3D 效率方法主要关注推理速度而不是主干压缩。为了解决这个限制,我们构建了一个适合图像到形状 DiT 的几何感知压缩框架。根据 3D DiT 层对几何合成表现出非均匀重要性的观察,我们引入了一种集成结构化修剪、自适应量化和目标 微调 的活力引导框架。我们的方法在最先进的图像到 3D 模型中实现了高达 66% 的模型尺寸缩小,同时保持了与全尺寸模型相当的合成保真度。这凸显了我们的框架作为即插即用解决方案的潜力,可跨不同模型高效生成 3D 形状。