论文

显示信号,隐藏噪声:像素空间扩散的光谱强迫

Show the Signal, Hide the Noise: Spectral Forcing for Pixel-Space Diffusion

模型训练预训练

摘要

像素空间扩散模型是在全带宽噪声图像上训练的,但降噪器可用的有用信号强烈依赖于频率。在整流流扩散和自然图像幂律谱下,每频带数据到噪声轮廓 $k^{*}(t) = (1-t)^{-2/α}$ 在每个时间 $t$ 将承载信号的低频区域与噪声主导的高频区域分开。我们证明这种隐含的从粗到细的结构不仅仅是描述性的:它引发了容量分配问题。标准像素空间降噪器必须在内部发现移动带宽边界,并且可以将计算花费在最佳预测崩溃到确定性基线而不是数据分布建模的频率时间区域上。为了使这个边界变得明确,我们引入了频谱强制,这是一种无参数、时间条件的 2D-DCT 低通算子,应用于补丁嵌入器之前的噪声输入。它的截止值随着扩散时间单调扩展,并成为数据端点处的恒等式。通过受控合成实验,我们确定了算子受益的机制:粗补丁标记化和高频内容主要是噪声而不是基本信号的数据。在使用 JiT-700M/32 的 ImageNet-256 上,Spectral Forcing 在不同的训练时期持续提高 FID 和 Inception Score,展示了整个训练过程中的强劲收益;在更精细的标记化下,谱强迫仍然具有竞争力。我们进一步将未改变的算子插入到统一的文本到图像模型 SenseNova-U1 中,它改进了 DPG-Bench 和 GenEval,表明输入侧光谱先验转移超出了类条件生成。这些结果提出了一种通过显示信号并隐藏噪声来实现容量高效的像素空间扩散的途径。