论文
D-DOIT:无需训练通过 Doob 的 h 变换适应离散扩散
D-DOIT: Training-free Adaptation of Discrete Diffusion via Doob's h-Transform
摘要
我们提出了 D-DOIT(离散 Doob 导向的推理时变换),这是一种无需训练和具有通用奖励的离散扩散模型的高效适应方法。 D-DOIT 将适应公式化为从奖励倾斜的目标分布中采样,并通过离散扩散反向内核的 Doob 的 h 变换实现这种传输,仅使用奖励值而不是奖励梯度。与连续扩散不同,屏蔽离散扩散对分类token-显示转换进行采样,而不是连续状态更新。 D-DOIT 导出相应的离散 Doob 的 h 变换,它通过重新加权反向转移概率而不是添加漂移校正来指导采样。为了使这种转变切实可行,D-DOIT 避免了昂贵的未来执行轨迹。在每个引导步骤中,D-DOIT 对候选下一个状态进行采样,使用模型预测头将每个候选完成为一个干净的序列,使用奖励预言机评估每个完成情况,并以与奖励成比例的概率重新采样下一个状态。可选的后期 best-of-K 细化通过仅在去噪结束时分支轨迹来进一步提高样本质量,避免整个轨迹上的 $K$ 倍成本。根据经验,在监管 DNA 设计和蛋白质反向折叠基准方面,D-DOIT 优于无需训练指导基准。它提高了增强子活性和细胞类型特异性,同时保留了序列自然性,并在蛋白质反向折叠中实现了最高的成功率。
