论文

D-DOIT:无需训练通过 Doob 的 h 变换适应离散扩散

D-DOIT: Training-free Adaptation of Discrete Diffusion via Doob's h-Transform

模型推理解码与生成控制

摘要

我们提出了 D-DOIT(离散 Doob 导向的推理时变换),这是一种无需训练和具有通用奖励的离散扩散模型的高效适应方法。 D-DOIT 将适应公式化为从奖励倾斜的目标分布中采样,并通过离散扩散反向内核的 Doob 的 h 变换实现这种传输,仅使用奖励值而不是奖励梯度。与连续扩散不同,屏蔽离散扩散对分类token-显示转换进行采样,而不是连续状态更新。 D-DOIT 导出相应的离散 Doob 的 h 变换,它通过重新加权反向转移概率而不是添加漂移校正来指导采样。为了使这种转变切实可行,D-DOIT 避免了昂贵的未来执行轨迹。在每个引导步骤中,D-DOIT 对候选下一个状态进行采样,使用模型预测头将每个候选完成为一个干净的序列,使用奖励预言机评估每个完成情况,并以与奖励成比例的概率重新采样下一个状态。可选的后期 best-of-K 细化通过仅在去噪结束时分支轨迹来进一步提高样本质量,避免整个轨迹上的 $K$ 倍成本。根据经验,在监管 DNA 设计和蛋白质反向折叠基准方面,D-DOIT 优于无需训练指导基准。它提高了增强子活性和细胞类型特异性,同时保留了序列自然性,并在蛋白质反向折叠中实现了最高的成功率。

D-DOIT:无需训练通过 Doob 的 h 变换适应离散扩散的原论文方法或结果图
图 1:D-DOIT 概述。左:标准掩蔽扩散在每个反向步骤中独立地揭露位置 (2.1);它很便宜,但没有回报。右图:一个引导步骤近似倾斜反向内核:它从经过调整的提案(3.6)中抽取 $M{=}3$ 候选者,用预测头和奖励完成它们并对其进行评分以获得代理 $h$ 值,并使用锐化的 $h$ 权重选择下一个状态(3.7)。底部:可选的最佳 $K$ 细化在分割后将每个轨迹复制到 $K{=}4$ 副本中,并保留最高奖励后缀 (3.9),共享前缀计算。揭示token保持固定;实际采样器不继承精确目标保证。