论文

扩散对齐的易处理性景观:正则化、奖励和计算原语

The tractability landscape of diffusion alignment: regularization, rewards, and computational primitives

模型推理解码与生成控制

摘要

推理时奖励对齐询问如何将具有基本定律 $p$ 的预训练扩散模型转变为有利于奖励 $r$ 同时保持接近 $p$ 的采样器。由于这种紧密度约束没有典型的分布距离,因此不同的选择会导致不同的“奖励对齐”法则,并且同样重要的是,会导致不同的算法问题。我们开发了一种基于原语的奖励对齐方法:我们不是假设可以对任意奖励对齐法则进行采样,而是询问哪些简单的算法原语足以实现非平凡奖励类的对齐。如果以 KL 距离来衡量接近度,则目标定律为 $q(x) \propto p(x) \exp(λ^{-1}r(x))$。对于这种设置,我们表明,$q(x)\propto p(x)\exp(\langle θ, x \rangle)$ 形式的线性指数倾斜——根据最近的工作[MRR26]可以有效地从中采样——是一个足够的原语,可以与非常广泛的凸低维奖励对齐。如果以 Wasserstein 距离来衡量接近度,则相应的基元是近端传输预言:给定 $x$,求解 $\mbox{argmax}_y \{r(y)- λc(x,y)\}$。该预言机可以有效地实现凹或低维 Lipschitz 奖励 $r(x)=f(Ax)$。总之,这些结果表明,对齐的分布距离的选择会影响计算原语和易于处理的奖励类别。