论文
来自结构不可知蒸馏的可扩散潜变量
Diffusable Latents from Structure-Agnostic Distillation
摘要
将预训练的基础模型提炼到自动编码器瓶颈中可以提高潜在扩散性,使扩散模型能够更快地收敛并达到更高的样本质量。标准蒸馏将每个位置的潜在布局与位于同一位置的教师特征对齐,将潜在布局与教师的布局联系起来。我们证明这个约束是不必要的:将单个池化图像级描述符与教师的表现对齐,与密集位置蒸馏一样好或稍好。我们比较潜在形状和教师模式的一阶目标和关系池目标。一阶匹配自然地扩展到一维词元序列潜变量和跨模态,其中将文本编码器提炼为图像自动编码器仍然可以提高可扩散性;仅基于每个图像的最近邻的关系目标也可以改进它。代码和博客文章可在 https://github.com/AdrienRR/structure-agnostic-distillation 和 https://kyutai.org/blog/2026-09-28-structure-agnostic-distillation/. 获取